Skip to content
Evaluation sources

Humanity’s Last Exam

CAIS / Scale AI / 知识 · 横跨学科的高难度学术知识与推理。

Official evaluation
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started

What and how it measures

固定题集、工具条件和裁判;HLE、HLE-Rolling 与带工具结果分别比较。AA v4.3 已包含 HLE,将来若有可用专项成绩,只用于分类,不在综合榜重复计票。

How this evidence is used

观察中:官方已补充部分新品,原始成绩仍缺少可验证的评测日期;不套用 Epoch 自评数据许可,不把已有 AA 综合证据再次加分。

Evaluation limits and attribution

观察中:官方已补充部分新品,原始成绩仍缺少可验证的评测日期;不套用 Epoch 自评数据许可,不把已有 AA 综合证据再次加分。

Data license: 评测代码 MIT;官方榜单成绩再展示边界尚待确认。

成绩由 CAIS / Scale AI 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。