arXiv · Computation and Language· Zizhuo Fu, Runsheng Wang, Meng Li·· 3 小时前AI 评分38
NAMOH:通过激活部分注意力头实现原生稀疏注意力以扩展参数与上下文
Scaling Parameter and Context in Attention: Native Sparse Attention from Mixture-of-Head
AI 导读
NAMOH 是一种架构原生稀疏注意力机制,每个 token 仅激活 H 个头中的 K 个,每个头只在其分配的 token 子序列上执行因果注意力。增加 H 同时固定 K 可缩短每个头的历史、减少每 token 的 KV 访问,且不增加总 KV 存储。实验表明 NAMOH 在相同总参数下优于全激活模型,并在匹配活跃参数时比更小稠密模型更高效地支持长上下文推理。
来源:arXiv · Computation and Language · arxiv.org