跳到正文
原文
arXiv · Artificial Intelligence· Jiajun Wu, Jian Yang, Zixiang Ni, Zhenzhu Li, Bin Chong·· 3 小时前AI 评分38

CARAT:材料科学大语言模型是在推理还是复述?

CARAT: Do Materials LLMs Reason or Recite?

AI 导读

CARAT 通过固定问题与标准答案、命名结构关系、匹配微调、答案遮蔽、证据注入与配对推理,检验材料 LLM 是否真正推理。GraphSpace 比普通周期图高 19.3 分,但其中 1.96 分来自基线缺失字段,46.7 分来自完全遗漏;基线 headline 主要衡量基线不足。

来源:arXiv · Artificial Intelligence · arxiv.org