热点事件持续更新
语言模型在序列任务需求下注意力头活动重新分配方式存在差异
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026-09-30,arXiv·Machine Learning 发表研究,通过固定提示长度、变化序列步骤需求,测量 17 个开源权重模型各层注意力头活动分布。结果显示:Qwen2.5(0.5B–7B)比平均模型更分散且集中在后半部分;Llama(1B–8B)和 OLMo-2 更集中;Llama-3.1-70B 与 Qwen2.5-72B 层数与头数相同但模式仍不同。微调模型保留了基座模型的大部分模式,活动越集中于顶部头越依赖这些头得出结论。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv · Machine Learning语言模型在序列任务需求下如何重新分配注意力头活动
研究固定提示长度、变化序列步骤需求,测量了 17 个开源权重模型各层的注意力头活动分布。Qwen2.5(0.5B–7B)比平均模型更分散活动、集中在后半部分;Llama(1B–8B)和 OLMo-2 更集中;Llama-3.1-70B 与 Qwen2.5-72B 层数与头数相同但模式仍不同。微调模型保留了基座模型的大部分模式,活动越集中于顶部头越依赖这些头得出结论。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。