Evaluation sourcesOfficial evaluation
SWE-rebench
Nebius / 编程 · 持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
固定任务窗口、ReAct 环境和 text/tools 交互协议,采用多次运行的平均解决率与标准误;不把完整 Agent 产品与基础模型混为同一对象。
How this evidence is used
候选观察:真实仓库任务值得补充,等待可验证运行日期、稳定成绩协议与再展示边界;尚未启用自动采集或计分。
Evaluation limits and attribution
滚动题目、运行环境和任务窗口影响可比性;网站近期维护不等于所有模型重新测试。
Data license: 官方 Hugging Face CC BY 4.0 数据集是任务题库;尚未确认网页最终成绩的稳定导出与再展示边界。
成绩由 Nebius 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。