跳到正文
原文
arXiv · Software Engineering· Yuqing Zhai, Xiaohong Chen, Lingming Zhang, Sriram Vishwanath, Grigore Rosu·· 3 小时前AI 评分25

编码智能体的验证失败如何转化为可复用指导

From Verification Failures to Reusable Guidance for Coding Agents

AI 导读

研究将专家对验证失败的诊断转化为可复用指导,结合 K 框架的可执行语言定义与规范构建、补全证明及审计工具包。在 HumanEval 164 个 Python 任务上,经两次针对性修复后 AI 审计 Pass 率达 164/164;KleverBench 测试 31 个操作符语义变更的程序,结果混合,提示需在资源限制下选择有效指导。

来源:arXiv · Software Engineering · arxiv.org