arXiv · Software Engineering· Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang·· 3 小时前AI 评分32
Chart2Code:面向图表理解与代码生成的分层基准测试
From Charts to Code: A Hierarchical Benchmark for Multimodal Models
AI 导读
Chart2Code 包含 2,023 个任务、22 种图表类型,分三级评估图表理解与代码生成能力。GPT-5 在编辑任务上代码正确率均分 0.57、图表质量均分 0.22,凸显任务难度。代码与数据已公开。
来源:arXiv · Software Engineering · arxiv.org