跳到正文
原文
arXiv · Computation and Language· Vincent Siu, Glenn Grant-Richards, Vlad Pavlovich, Yizhou Sun, Dawn Song, Chenguang Wang·· 3 小时前AI 评分40

Transformer 拒答机制中的组件与维度稀疏性

Component and Dimension Sparsity in Transformer Refusal Mechanisms

AI 导读

研究将拒答 steering 分解为组件级干预,在四个开源模型上定位到足以复现完整行为效果的稀疏注意力与 MLP 组件子集。拒答方向集中在占上游组件 28–48% 的稀疏机制中,保留 88–101% 的 steering 效果;机制内部又集中在约 50% 的残差流维度,保留 85–98% 的基线。代码与原始实验结果已公开。

来源:arXiv · Computation and Language · arxiv.org