arXiv · Machine Learning Theory· Shicheng Liu, Adam Kahirov, Qi Zhang, Zhimin Hu, Song Wang, Junhong Lin, Julian Shun, Yada Zhu·· 16 小时前AI 评分41
VisAudit:评测多模态智能体的视觉诊断与修复能力
VisAudit: Evaluating Multimodal Agents for Visual Diagnosis and Repair
AI 导读
VisAudit 是一个评测可视化诊断、修复与验证的基准,覆盖 21 种图表类型、10 类缺陷,含 1,900 个有缺陷实例和 300 个初始正确图表,并设诊断修复、自主修复与开放世界验证三条赛道。基准通过受控扰动构建,注入缺陷可定义且可恢复。实验显示,最强评测模型在自主修复设定下仅完全恢复 47.4% 的有缺陷图表。
来源:arXiv · Machine Learning Theory · arxiv.org