arXiv · Software Engineering· Gabriel Orlanski, Alex L. Zhang, Avi Trost, Vincent Sunn Chen, Frederic Sala, Aws Albarghouthi, Ludwig Schmidt·· 7 小时前AI 评分40
Can Agents Design Libraries for Agents?(LibraryDesignBench 评估智能体为其他智能体设计库的能力)
Can Agents Design Libraries for Agents?
AI 导读
研究提出 LibraryDesignBench 两阶段基准,评估智能体根据规格说明设计库的能力,覆盖 242 个编程问题、15 个库设计任务、4 种语言。在 15 个任务中 11 个智能体设计出的抽象与人类编写的生产库一致;下游智能体同样采用智能体编写的库,但因库不够灵活或难用而重复实现已有能力。实验表明,给设计者更明确的智能体优先指导并让其用子智能体测试,可提升下游得分并简化程序。
来源:arXiv · Software Engineering · arxiv.org