跳到正文
原文
arXiv · Software Engineering· Bowen Yang, Jiajun Jiang, Luxue Yu, Yihao Wang, Fengjie Li, Dong Wang·· 3 小时前AI 评分33

PolyCodeEval:从函数到仓库的多语言代码生成基准

PolyCodeEval: Benchmarking Multilingual Code Generation from Functions to Repositories

AI 导读

PolyCodeEval 是一个统一的多语言、多粒度代码生成基准,包含 2,590 个任务,覆盖 5 种编程语言、58 个真实可执行开源仓库,从函数到仓库层级均用统一执行式协议评测。评测显示,现有方法在函数、文件、仓库上的正确率最高分别为 71.7%、76.7% 和 31.0%,且排名随粒度和语言变化。

来源:arXiv · Software Engineering · arxiv.org