热点事件持续更新
长上下文混合模型机理研究:从混合注意力到混合位置
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月8日,arXiv Computation and Language 发表一手论文《长上下文混合模型机理 1.1:从混合注意力到混合位置》,提出长上下文混合模型机理系列。论文比较全注意力与滑动窗口注意力(SWA)、线性注意力(LA,含 GLA 与 GDN)的混合架构,发现上下文扩展中的跷跷板效应:LA 混合更受益于长上下文持续预训练,SWA 混合在长度外推上更好;SWA 存在短上下文学习陷阱、短窗倦怠与长窗懒惰。论文提出滑动窗口线性注意力,实现 16 倍免训练长度外推,在 64k 上下文 NIAH-SK1 保持 100% 准确率。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
新论文提出滑动窗口线性注意力,实现16倍免训练长度外推,64k上下文NIAH-SK1准确率100%。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · Computation and Language长上下文混合模型机理 1.1:从混合注意力到混合位置
论文提出长上下文混合模型机理系列,比较全注意力与滑动窗口注意力(SWA)、线性注意力(LA,含 GLA 与 GDN)混合架构。发现上下文扩展中的跷跷板效应:LA 混合更受益于长上下文持续预训练,SWA 混合在长度外推更好;SWA 存在短上下文学习陷阱、短窗倦怠与长窗懒惰。提出滑动窗口线性注意力,实现 16 倍免训练长度外推,在 64k 上下文 NIAH-SK1 保持 100% 准确率。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。