arXiv · Software Engineering· Jiaru Qian, Yihong Dong, Yongmin Li, Hao Zhu, Bin Gu, Ge Li·· 3 小时前AI 评分38
Self-Spec Verifiable Code Generation
Self-Spec Verifiable Code Generation
AI 导读
VeriCodeBench 评测自生成规范的可验证代码能力,覆盖 C、Java、Rust、Python 400 个语言原生问题。CodeNova 通过约束引导规范与验证反馈修复提升表现,使 Claude Sonnet 5 在自规范协议下达最强结果。自生成规范仍是主要瓶颈,更复杂规范未必提高验证成功率。
来源:arXiv · Software Engineering · arxiv.org