跳到正文
热点事件持续更新

SSU-Bench:视觉语言模型安全判断的因果追踪

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月7日,arXiv(Artificial Intelligence,一手来源)发表研究,提出SSU-Bench数据集,通过单项提示词编辑或图像编辑构建匹配的安全与不安全图文组合,并标注目标区域。研究在三种视觉语言模型上跨配对输入迁移内部状态,测量安全判定的变化:改动输入位置的干预在较早decoder层生效,最终输入token的干预则在更晚层生效。最终token状态的线性读出可预测模型自身判定(含错误判断),跨模型比较显示反事实变化模式存在相似性。目前未见后续验证或争议报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · Artificial Intelligence
    视觉语言模型中的因果追踪:从局部证据到安全判定

    研究提出 SSU-Bench 数据集,包含通过单项提示词编辑或图像编辑构建的匹配安全与不安全图文组合,并标注目标区域。在三种视觉语言模型上跨配对输入迁移内部状态后,测量安全判定的变化:改动输入位置的干预在较早 decoder 层生效,最终输入 token 的干预则在更晚层生效。最终 token 状态的线性读出可预测模型自身判定(含错误判断),跨模型比较显示反事实变化模式存在相似性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。