arXiv · Machine Learning· Johnny Jingze Li, Abdulla Kuleib, Kalyan Basu, Gabriel A. Silva·· 6 小时前AI 评分27
语言模型在序列任务需求下如何重新分配注意力头活动
How Language Models Differ in Redistributing Attention-Head Activity Under Serial Demand
AI 导读
研究固定提示长度、变化序列步骤需求,测量了 17 个开源权重模型各层的注意力头活动分布。Qwen2.5(0.5B–7B)比平均模型更分散活动、集中在后半部分;Llama(1B–8B)和 OLMo-2 更集中;Llama-3.1-70B 与 Qwen2.5-72B 层数与头数相同但模式仍不同。微调模型保留了基座模型的大部分模式,活动越集中于顶部头越依赖这些头得出结论。
来源:arXiv · Machine Learning · arxiv.org