跳到正文
原文
arXiv · Computation and Language· David I. Atkinson, Dillon Plunkett, David Bau·· 3 小时前AI 评分47

如何从内部识别大语言模型的内省

Identifying Introspection From the Inside

AI 导读

论文提出在受控设置中识别忠实自我报告的机制特征:用低秩适配器训练模型按潜在线性偏好函数为虚构角色做决策,持续微调隐式决策任务后,模型无需显式自我报告监督即可准确报告所学偏好。权重消融与冻结层实验显示偏好表征随训练移向更早的层,与忠实自我报告需让偏好位于既有言语化机制可及位置的假设一致。归因修补显示忠实模型的决策与自我报告任务间归因相似度显著更高,可在不必理解报告内容的情况下区分忠实与不忠实模型。

来源:arXiv · Computation and Language · arxiv.org