跳到正文
原文
arXiv · Computation and Language· Xiaoran Liu, Ziwei He, Xipeng Qiu·· 4 小时前AI 评分40

长上下文混合模型机理 1.1:从混合注意力到混合位置

Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

AI 导读

论文提出长上下文混合模型机理系列,比较全注意力与滑动窗口注意力(SWA)、线性注意力(LA,含 GLA 与 GDN)混合架构。发现上下文扩展中的跷跷板效应:LA 混合更受益于长上下文持续预训练,SWA 混合在长度外推更好;SWA 存在短上下文学习陷阱、短窗倦怠与长窗懒惰。提出滑动窗口线性注意力,实现 16 倍免训练长度外推,在 64k 上下文 NIAH-SK1 保持 100% 准确率。

来源:arXiv · Computation and Language · arxiv.org