跳到正文
原文
arXiv · Computation and Language· Or Shafran, Mor Geva·· 3 小时前AI 评分37

容量、响应性与对齐:什么让潜在结构具备因果可操作性

Capacity, Responsiveness and Alignment: What Makes a Latent Structure Actionable

AI 导读

研究将语言模型潜在结构的因果影响分解为容量、响应性与对齐三因素,在 4 个 LM 族与 50 个概念上验证三者需同时为高。低容量与低响应性分别使因果效果降低 84% 与 95%,低对齐则可能反转并抑制概念表达,且因果方向随上下文形成低维子空间。基于该子空间训练的 causal probes 在多个模型上提升 17%-118% 的 steering 效果,概念检测仅下降 3%。

来源:arXiv · Computation and Language · arxiv.org