Skip to content
Hot eventLive

多模态法官视觉证据审计:Grounding分数混淆与选择偏差

2 reports2 sources3 hr ago updated

Get the story

AI overview

2026-10-02 两篇一手研究共同审视 VLM 作为法官时的视觉证据使用问题。第一篇提出 Verdict Grounding Score,通过反事实编辑图像检验模型是否依据视觉证据做判断,指出该分数受编辑可感知性上限影响,只能单向让法官显得不 grounded,产生假阳性;作者基于审计协议已收集的三个量识别假阳性率,对九个法官审计后验证排序关系,并建议配合图像侧检测探针校准。第二篇审计 VLM 在 300 个文化相关提示上作为图像选择裁判的表现:4B 裁判仅略优于随机(选第一张图 49% vs 随机 28%),重排候选顺序后 60% 提示改变选择;8B 裁判几乎无位置偏差且超越 CLIP,但其过滤器会丢弃更多正确决策;裁判间一致性仅在针对其失败模式时有用,更换裁判需重新审计过滤器。

Generated from reports · updated 2 hr ago

Developments

2 developments
  1. Oct 2 · 1 reports
    低Grounding分数不等于未使用视觉证据:多模态监督中的可感知性混淆
    arXiv · Computer Vision: 低 Grounding 分数不代表未使用证据:多模态监督中的可感知性混淆
  2. Oct 2 · 1 reports
    VLM作为图像选择裁判的审计:文化情境提示下的偏差与重排序效应
    arXiv · Computers and Society: When the Judge Acts: Auditing VLM-Guided Image Selection on Culturally Situated Prompts

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Computer Vision精选
    低 Grounding 分数不代表未使用证据:多模态监督中的可感知性混淆

    论文提出 Verdict Grounding Score,通过反事实编辑图像并保持推理链不变来检验模型法官是否依据视觉证据做出判断。研究指出该分数受编辑可感知性上限影响,且只能单向让法官看起来更不 grounded,产生假阳性。方法可从审计协议已收集的三个量中识别假阳性率,作者对九个法官审计后验证了排序关系,并建议将图像侧检测探针与反事实分数配合使用以校准结果。

  2. arXiv · Computers and Society精选
    When the Judge Acts: Auditing VLM-Guided Image Selection on Culturally Situated Prompts

    研究审计了 VLM 作为图像选择裁判时的决策偏差:在 300 个文化相关提示上,4B 参数裁判仅略优于随机选择,49% 的情况选第一张图(随机为 28%),重排候选顺序后 60% 的提示改变选择;8B 裁判几乎无位置偏差且超越 CLIP,但对其同样的过滤器会丢弃更多正确决策。裁判间一致性仅在针对其失败模式时才有用,且裁判更换后需重新审计过滤器。

Heat trend

There is not enough continuous observation data to draw a trend yet.