Skip to content
Hot eventLive

SSU-Bench:视觉语言模型安全判断的因果追踪

1 reports1 sources3 hr ago updated

Get the story

AI overview

2026年10月7日,arXiv(Artificial Intelligence,一手来源)发表研究,提出SSU-Bench数据集,通过单项提示词编辑或图像编辑构建匹配的安全与不安全图文组合,并标注目标区域。研究在三种视觉语言模型上跨配对输入迁移内部状态,测量安全判定的变化:改动输入位置的干预在较早decoder层生效,最终输入token的干预则在更晚层生效。最终token状态的线性读出可预测模型自身判定(含错误判断),跨模型比较显示反事实变化模式存在相似性。目前未见后续验证或争议报道。

Generated from reports · updated 3 hr ago

Timeline

Follow the coverage from different angles.

Oct 7, 2026
  1. arXiv · Artificial Intelligence
    视觉语言模型中的因果追踪:从局部证据到安全判定

    研究提出 SSU-Bench 数据集,包含通过单项提示词编辑或图像编辑构建的匹配安全与不安全图文组合,并标注目标区域。在三种视觉语言模型上跨配对输入迁移内部状态后,测量安全判定的变化:改动输入位置的干预在较早 decoder 层生效,最终输入 token 的干预则在更晚层生效。最终 token 状态的线性读出可预测模型自身判定(含错误判断),跨模型比较显示反事实变化模式存在相似性。

Heat trend

There is not enough continuous observation data to draw a trend yet.