热点事件持续更新
NAMOH原生稀疏注意力通过激活K个头扩展参数与上下文
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026-10-01,arXiv《Computation and Language》报道NAMOH:一种架构原生稀疏注意力机制。每个token仅激活H个头中的K个,每个头只在其分配的token子序列上执行因果注意力。增加H同时固定K可缩短每个头的历史、减少每token的KV访问,且不增加总KV存储。实验表明NAMOH在相同总参数下优于全激活模型,并在匹配活跃参数时比更小稠密模型更高效地支持长上下文推理。
AI 根据报道生成 · 1 小时前更新
最新进展10月1日 12:00
2026-10-01 arXiv发布NAMOH稀疏注意力机制论文,声称可在不增加KV存储下扩展参数与上下文。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv · Computation and LanguageNAMOH:通过激活部分注意力头实现原生稀疏注意力以扩展参数与上下文
NAMOH 是一种架构原生稀疏注意力机制,每个 token 仅激活 H 个头中的 K 个,每个头只在其分配的 token 子序列上执行因果注意力。增加 H 同时固定 K 可缩短每个头的历史、减少每 token 的 KV 访问,且不增加总 KV 存储。实验表明 NAMOH 在相同总参数下优于全激活模型,并在匹配活跃参数时比更小稠密模型更高效地支持长上下文推理。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。