Skip to content
Evaluation sources

SWE-rebench

Nebius / 编程 · 持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。

Official evaluation
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started

What and how it measures

固定任务窗口、ReAct 环境和 text/tools 交互协议,采用多次运行的平均解决率与标准误;不把完整 Agent 产品与基础模型混为同一对象。

How this evidence is used

候选观察:真实仓库任务值得补充,等待可验证运行日期、稳定成绩协议与再展示边界;尚未启用自动采集或计分。

Evaluation limits and attribution

滚动题目、运行环境和任务窗口影响可比性;网站近期维护不等于所有模型重新测试。

Data license: 官方 Hugging Face CC BY 4.0 数据集是任务题库;尚未确认网页最终成绩的稳定导出与再展示边界。

成绩由 Nebius 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。