跳到正文
原文
arXiv · Computation and Language· Gurbir Arora, Toni J. B. Liu, Jiajun Bao, Rapha\"el Sarfati, Christopher J. Earls·· 6 小时前AI 评分40

大语言模型组合任务中的因果与可解释结构

Causal and Interpretable Structures in LLM Compositional Tasks

AI 导读

研究团队分析 Llama、Qwen、Gemma 和 Mistral 在循环概念(月份、小时、星期、音乐音符)提示下的激活表征,发现中间层使用两个 token 的联合表征,后期层使用三个 token 的联合表征来完成下一个 token 预测。几何上结构化但因果上无效的关系也被识别,而限制模型使用因果相关的联合表征反而提升了预测准确率。

来源:arXiv · Computation and Language · arxiv.org