arXiv · Computation and Language· Muhammad Usama, Dong Eui Chang·· 8 hr agoSelectedAI score73
系统提示幻觉:指令前言如何改变语言模型的计算
The System Prompt Illusion: How Instruction Preambles Modify Computation in Language Models
AI brief
论文通过 Centered Kernel Alignment 比较 17 个指令微调模型在 20 种系统提示下的层表示,发现 persona 与格式指令会深度重构中间表示,而安全指令几乎不改变表示,与最小基线无统计差异。
Why it matters
用 CKA 揭示系统提示在不同层的作用差异,为理解安全指令为何容易被绕过提供了可解释机制。
Source: arXiv · Computation and Language · arxiv.org