Evaluation sourcesOfficial evaluation
BullshitBench v2
Peter Gostev / BullshitBench / 知识 · 识别问题里的错误前提,观察模型会不会顺着错误继续编造。
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
采用官方默认的全部尝试中明确识别比例,并保留已作答回应平均分;拒答比例保留供审计。两项原始指标不进入当前综合或分类票权。
How this evidence is used
原始成绩参考:按同一公开数据版本核对汇总、题集、配置与运行日期后自动采集。匿名型号不公开,无法确认固定版本的滚动接口不作为模型代表成绩;当前不进入综合或分类分数。
Evaluation limits and attribution
全部为错误前提题,不能代表一般知识广度;模型裁判和拒答处理影响结果,滚动别名及匿名型号须先完成身份核验。
Data license: MIT · Copyright (c) 2026 Peter Gostev;官方成绩随同仓库发布,无单独数据许可例外。
成绩由 Peter Gostev / BullshitBench 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。