跳到正文
热点事件持续更新

OpenProblemBench:基础理论科学开放问题基准发布

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月9日,研究者在arXiv发布OpenProblemBench,用于评测AI在基础理论科学开放问题上的能力。该基准包含82个来自数学与理论物理文献的未解决问题,每个问题提供研究背景、假设与既有进展。评估采用四个模型独立评判提交的正确性、完整性与进展程度,无需参考答案。在七个被评测配置中,GPT-6-Astra平均解题率最高,为14.0%;全尺寸开源模型为5.5%-6.7%;Flash模型为2.4%-3.7%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv · Artificial Intelligence
    OpenProblemBench:评测 AI 在基础理论科学开放问题上的能力

    研究者发布 OpenProblemBench,包含 82 个来自数学与理论物理文献的未解决问题,每个问题提供研究背景、假设与既有进展。四个评估模型独立评判提交的正确性、完整性与进展程度,无需参考答案。七个被评测配置中,GPT-6-Astra 平均解题率最高为 14.0%,全尺寸开源模型为 5.5-6.7%,Flash 模型为 2.4-3.7%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。