arXiv · Software Engineering· Hang He, Li Wang, Hao Chen, Yuchen Shao, Yuling Shi, Lisheng Wang, Peiyang Liu, Goose Lin, Zaiyuan Wang, Haiying Sun, Ting Su, Chengcheng Wan·· 3 小时前AI 评分37
CheckerBench:长程 AI 智能体能否合成静态分析检查器?
CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
AI 导读
研究者发布 CheckerBench,一个包含 300 个任务的可执行基准,源自 297 个 CVE、167 个仓库、85 种 CWE 与五种语言生态,用于评估 AI 智能体从零开发静态分析检查器的能力。
来源:arXiv · Software Engineering · arxiv.org