UK AISI 与 EvalEval 合作让基准测试结果可复现
summary_zh: UK AISI 通过 EvalEval 的 Evaluation Cards 平台公开分享五个基准的评估结果,覆盖 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六个前沿模型,并附带 HealthBench、Humanity's Last Exam、SWE-Bench Pro 等评测的设置与配置信息。
summary_zh: UK AISI 通过 EvalEval 的 Evaluation Cards 平台公开分享五个基准的评估结果,覆盖 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六个前沿模型,并附带 HealthBench、Humanity's Last Exam、SWE-Bench Pro 等评测的设置与配置信息。
Import AI 469 期报道 DiG-bench 基准,该基准包含 70 个游戏测试 AI 系统探索隐藏规则的能力。Opus 5 和 Fable 5 是最佳模型,仅在 tier 7 取得 0.2 成功率,而人类可达 100%。
微软研究院的新基准 MindTopo 发现,专有与开放权重多模态模型在静态拓扑推理上明显强于交互规划,且都远低于人类。它按连续性、分离、顺序、包围和绳结五类,测试静态场景问答,以及模拟环境中须维持或改变关系的动作规划。规划失败常在理解场景之后出现,模型失去对结构关系的追踪,或提出违反环境约束的动作。
Google Research 推出 PaperVizAgent 与 ScholarPeer 两款学术智能体,分别用于生成论文配图和自动同行评审。