跳到正文
热点事件持续更新

多模态法官视觉证据审计:Grounding分数混淆与选择偏差

2 篇报道2 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026-10-02 两篇一手研究共同审视 VLM 作为法官时的视觉证据使用问题。第一篇提出 Verdict Grounding Score,通过反事实编辑图像检验模型是否依据视觉证据做判断,指出该分数受编辑可感知性上限影响,只能单向让法官显得不 grounded,产生假阳性;作者基于审计协议已收集的三个量识别假阳性率,对九个法官审计后验证排序关系,并建议配合图像侧检测探针校准。第二篇审计 VLM 在 300 个文化相关提示上作为图像选择裁判的表现:4B 裁判仅略优于随机(选第一张图 49% vs 随机 28%),重排候选顺序后 60% 提示改变选择;8B 裁判几乎无位置偏差且超越 CLIP,但其过滤器会丢弃更多正确决策;裁判间一致性仅在针对其失败模式时有用,更换裁判需重新审计过滤器。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月2日 12:00 · 1 篇报道
    低Grounding分数不等于未使用视觉证据:多模态监督中的可感知性混淆
    arXiv · Computer Vision:低 Grounding 分数不代表未使用证据:多模态监督中的可感知性混淆
  2. 10月2日 12:00 · 1 篇报道
    VLM作为图像选择裁判的审计:文化情境提示下的偏差与重排序效应
    arXiv · Computers and Society:When the Judge Acts: Auditing VLM-Guided Image Selection on Culturally Situated Prompts

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Computer Vision精选
    低 Grounding 分数不代表未使用证据:多模态监督中的可感知性混淆

    论文提出 Verdict Grounding Score,通过反事实编辑图像并保持推理链不变来检验模型法官是否依据视觉证据做出判断。研究指出该分数受编辑可感知性上限影响,且只能单向让法官看起来更不 grounded,产生假阳性。方法可从审计协议已收集的三个量中识别假阳性率,作者对九个法官审计后验证了排序关系,并建议将图像侧检测探针与反事实分数配合使用以校准结果。

  2. arXiv · Computers and Society精选
    When the Judge Acts: Auditing VLM-Guided Image Selection on Culturally Situated Prompts

    研究审计了 VLM 作为图像选择裁判时的决策偏差:在 300 个文化相关提示上,4B 参数裁判仅略优于随机选择,49% 的情况选第一张图(随机为 28%),重排候选顺序后 60% 的提示改变选择;8B 裁判几乎无位置偏差且超越 CLIP,但对其同样的过滤器会丢弃更多正确决策。裁判间一致性仅在针对其失败模式时才有用,且裁判更换后需重新审计过滤器。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。