Evaluation sourcesOfficial evaluation
SimpleBench
SimpleBench / 推理 · 用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
区分选择题与开放回答,固定 AVG@5、温度和提示协议;不把加入榜单日期当逐题评测时间。
How this evidence is used
候选观察:新品覆盖及时,等待官网成绩复用边界与可冻结的数据版本说明;不套用代码许可,尚未自动采集或计分。
Evaluation limits and attribution
日常常识题具有补充价值,但题目代表性与选择题/开放回答条件均影响解释。
Data license: 样题与评测代码仓库 MIT;官网独立发布的最新成绩脚本再展示边界尚未确认。
成绩由 SimpleBench 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。