Skip to content
Hot eventLive

研究探索从内部识别大语言模型内省

1 reports1 sources3 hr ago updated

Get the story

AI overview

2026年10月7日,arXiv Computation and Language 发布一手论文《如何从内部识别大语言模型的内省》。论文在受控设置中提出识别忠实自我报告的机制特征:用低秩适配器训练模型按潜在线性偏好函数为虚构角色做决策,持续微调隐式决策任务后,模型无需显式自我报告监督即可准确报告所学偏好。权重消融与冻结层实验显示,偏好表征随训练移向更早的层,与忠实自我报告需让偏好位于既有言语化机制可及位置的假设一致。归因修补显示忠实模型的决策与自我报告任务间归因相似度显著更高,可在不必理解报告内容的情况下区分忠实与不忠实模型。

Generated from reports · updated 3 hr ago

Timeline

Follow the coverage from different angles.

Oct 7, 2026
  1. arXiv · Computation and Language
    如何从内部识别大语言模型的内省

    论文提出在受控设置中识别忠实自我报告的机制特征:用低秩适配器训练模型按潜在线性偏好函数为虚构角色做决策,持续微调隐式决策任务后,模型无需显式自我报告监督即可准确报告所学偏好。权重消融与冻结层实验显示偏好表征随训练移向更早的层,与忠实自我报告需让偏好位于既有言语化机制可及位置的假设一致。归因修补显示忠实模型的决策与自我报告任务间归因相似度显著更高,可在不必理解报告内容的情况下区分忠实与不忠实模型。

Heat trend

There is not enough continuous observation data to draw a trend yet.