arXiv · Software Engineering· Tianyu Liu, Dingyuan Dai, Yufan Du, Zhen Yang·· 7 小时前AI 评分42
ReviveBench 基准测试:编码智能体能否从死代码与静态需求中重建可运行的工业软件引擎
From Dead Code and Static Requirements to Working Engines: Software Revival with Coding Agents
AI 导读
ReviveBench 包含复活与重建两个任务族,分别测试编码智能体在依赖不兼容、缺失模块、遗留构建及 CAD/CRM 等系统中的修复与重建能力。最强模型在复活族十项任务中每项至少一次全部通过,在重建族十三项中有两个模型全部达标,但 CFD 任务无法验证数值求解能力。基准构建与审计发现 28 个验证器缺陷(24 个假阴性、2 个假阳性),表明可执行验证本身会引入显著测量误差。
来源:arXiv · Software Engineering · arxiv.org