跳到正文
原文
arXiv · Computation and Language· Muhammad Usama, Dong Eui Chang·· 2 小时前精选AI 评分73

系统提示幻觉:指令前言如何改变语言模型的计算

The System Prompt Illusion: How Instruction Preambles Modify Computation in Language Models

AI 导读

论文通过 Centered Kernel Alignment 比较 17 个指令微调模型在 20 种系统提示下的层表示,发现 persona 与格式指令会深度重构中间表示,而安全指令几乎不改变表示,与最小基线无统计差异。

推荐理由

用 CKA 揭示系统提示在不同层的作用差异,为理解安全指令为何容易被绕过提供了可解释机制。

来源:arXiv · Computation and Language · arxiv.org