跳到正文
原文
arXiv · Artificial Intelligence· Faezeh Dehghan Tarzjani, Mevan Wijewardena, Alexander Romanus, Sampad Mohanty·· 3 小时前AI 评分35

视觉语言模型中的因果追踪:从局部证据到安全判定

From Local Evidence to Safety Verdicts: Causal Tracing in Vision-Language Models

AI 导读

研究提出 SSU-Bench 数据集,包含通过单项提示词编辑或图像编辑构建的匹配安全与不安全图文组合,并标注目标区域。在三种视觉语言模型上跨配对输入迁移内部状态后,测量安全判定的变化:改动输入位置的干预在较早 decoder 层生效,最终输入 token 的干预则在更晚层生效。最终 token 状态的线性读出可预测模型自身判定(含错误判断),跨模型比较显示反事实变化模式存在相似性。

来源:arXiv · Artificial Intelligence · arxiv.org