Skip to content
Evaluation sources

FrontierSWE v2

Proximal Labs / 编程 · 长时间运行的工程实现与研究任务

Official evaluation
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started

What and how it measures

只比较 v2 的统一 Proximus harness,不与旧版和 best-of 不同条件混合。

How this evidence is used

观察中:长任务新型号覆盖仍较少,稳定原始数据入口和运行配置需要补齐。

Evaluation limits and attribution

观察中:长任务新型号覆盖仍较少,稳定原始数据入口和运行配置需要补齐。

Data license: 待确认榜单数据使用边界

成绩由 Proximal Labs 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。