跳到正文
原文
arXiv · Artificial Intelligence· Chenmu Zhang, Levi Felix, Jun-Jie Zhang, Xingfu Li, Xuelian Jiang, Tao Jiang, Subhendu Mishra, Xixi Qin, Boris Yakobson·· 3 小时前AI 评分37

CompMat-Bench:评测 AI 智能体在计算材料科学中的研究能力

CompMat-Bench: Benchmarking AI Agents for Computational Materials Science

AI 导读

CompMat-Bench 包含 94 个源自已发表计算材料研究的单步任务,通过预复现输入与结果作为 ground truth,避免评估时重复昂贵模拟。基于三个 LLM 的智能体在单任务全指引下通过率为 66.0-90.4%;长流程或减少指引会拉低弱智能体表现,最强智能体仅在长流程加少指引时下降。多数失败归因于科学错误而非软件使用错误。

来源:arXiv · Artificial Intelligence · arxiv.org