跳到正文
热点事件持续更新

VisAudit:多模态智能体可视化诊断与修复基准

1 篇报道1 个报道来源16 小时前 更新

先了解这件事

AI 综述

2026年10月5日,arXiv Machine Learning Theory 发布一手报道,介绍 VisAudit 基准,用于评测多模态智能体的可视化诊断、修复与验证能力。该基准覆盖 21 种图表类型、10 类缺陷,包含 1,900 个有缺陷实例和 300 个初始正确图表,并设置诊断修复、自主修复与开放世界验证三条赛道。基准通过受控扰动构建,注入的缺陷可定义且可恢复。实验显示,最强评测模型在自主修复设定下仅完全恢复 47.4% 的有缺陷图表。目前未见更早或相互矛盾的报道。

AI 根据报道生成 · 15 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv · Machine Learning Theory
    VisAudit:评测多模态智能体的视觉诊断与修复能力

    VisAudit 是一个评测可视化诊断、修复与验证的基准,覆盖 21 种图表类型、10 类缺陷,含 1,900 个有缺陷实例和 300 个初始正确图表,并设诊断修复、自主修复与开放世界验证三条赛道。基准通过受控扰动构建,注入缺陷可定义且可恢复。实验显示,最强评测模型在自主修复设定下仅完全恢复 47.4% 的有缺陷图表。

本事件热度走势

当前热度 7·可比范围峰值 10(10月5日 13:00)·近 24 小时可比范围变化 –

02.557.51010月5日13:0010月5日18:0010月5日22:0010月6日03:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。