跳到正文
热点事件持续更新

长上下文混合模型机理研究:从混合注意力到混合位置

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月8日,arXiv Computation and Language 发表一手论文《长上下文混合模型机理 1.1:从混合注意力到混合位置》,提出长上下文混合模型机理系列。论文比较全注意力与滑动窗口注意力(SWA)、线性注意力(LA,含 GLA 与 GDN)的混合架构,发现上下文扩展中的跷跷板效应:LA 混合更受益于长上下文持续预训练,SWA 混合在长度外推上更好;SWA 存在短上下文学习陷阱、短窗倦怠与长窗懒惰。论文提出滑动窗口线性注意力,实现 16 倍免训练长度外推,在 64k 上下文 NIAH-SK1 保持 100% 准确率。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · Computation and Language
    长上下文混合模型机理 1.1:从混合注意力到混合位置

    论文提出长上下文混合模型机理系列,比较全注意力与滑动窗口注意力(SWA)、线性注意力(LA,含 GLA 与 GDN)混合架构。发现上下文扩展中的跷跷板效应:LA 混合更受益于长上下文持续预训练,SWA 混合在长度外推更好;SWA 存在短上下文学习陷阱、短窗倦怠与长窗懒惰。提出滑动窗口线性注意力,实现 16 倍免训练长度外推,在 64k 上下文 NIAH-SK1 保持 100% 准确率。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。