Evaluation sourcesOfficial evaluation
FrontierCode
Cognition / 编程 · 真实仓库任务的质量、测试与修改范围
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
固定 v1.1 和官方运行条件;质量评分和测试成功共同构成一项任务证据。
How this evidence is used
观察中:尚无确认稳定的成绩导出与数据使用边界。
Evaluation limits and attribution
观察中:尚无确认稳定的成绩导出与数据使用边界。
Data license: 待确认榜单数据使用边界
成绩由 Cognition 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。