arXiv · Artificial Intelligence· Zhiyi Li, Sihan Hu, Tianning Xiao, Xiansheng Cai, Xiaojun Tan, Youjin Deng, Kun Chen·· 4 hr agoAI score45
OpenProblemBench:评测 AI 在基础理论科学开放问题上的能力
OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences
AI brief
研究者发布 OpenProblemBench,包含 82 个来自数学与理论物理文献的未解决问题,每个问题提供研究背景、假设与既有进展。四个评估模型独立评判提交的正确性、完整性与进展程度,无需参考答案。七个被评测配置中,GPT-6-Astra 平均解题率最高为 14.0%,全尺寸开源模型为 5.5-6.7%,Flash 模型为 2.4-3.7%。
Source: arXiv · Artificial Intelligence · arxiv.org