跳到正文
热点事件持续更新

语言模型在序列任务需求下注意力头活动重新分配方式存在差异

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30,arXiv·Machine Learning 发表研究,通过固定提示长度、变化序列步骤需求,测量 17 个开源权重模型各层注意力头活动分布。结果显示:Qwen2.5(0.5B–7B)比平均模型更分散且集中在后半部分;Llama(1B–8B)和 OLMo-2 更集中;Llama-3.1-70B 与 Qwen2.5-72B 层数与头数相同但模式仍不同。微调模型保留了基座模型的大部分模式,活动越集中于顶部头越依赖这些头得出结论。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Machine Learning
    语言模型在序列任务需求下如何重新分配注意力头活动

    研究固定提示长度、变化序列步骤需求,测量了 17 个开源权重模型各层的注意力头活动分布。Qwen2.5(0.5B–7B)比平均模型更分散活动、集中在后半部分;Llama(1B–8B)和 OLMo-2 更集中;Llama-3.1-70B 与 Qwen2.5-72B 层数与头数相同但模式仍不同。微调模型保留了基座模型的大部分模式,活动越集中于顶部头越依赖这些头得出结论。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。