arXiv · Software Engineering· Bowen Yang, Jiajun Jiang, Luxue Yu, Yihao Wang, Fengjie Li, Dong Wang·· 3 小时前AI 评分33
PolyCodeEval:从函数到仓库的多语言代码生成基准
PolyCodeEval: Benchmarking Multilingual Code Generation from Functions to Repositories
AI 导读
PolyCodeEval 是一个统一的多语言、多粒度代码生成基准,包含 2,590 个任务,覆盖 5 种编程语言、58 个真实可执行开源仓库,从函数到仓库层级均用统一执行式协议评测。评测显示,现有方法在函数、文件、仓库上的正确率最高分别为 71.7%、76.7% 和 31.0%,且排名随粒度和语言变化。
来源:arXiv · Software Engineering · arxiv.org