跳到正文
热点事件持续更新

NAMOH原生稀疏注意力通过激活K个头扩展参数与上下文

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-10-01,arXiv《Computation and Language》报道NAMOH:一种架构原生稀疏注意力机制。每个token仅激活H个头中的K个,每个头只在其分配的token子序列上执行因果注意力。增加H同时固定K可缩短每个头的历史、减少每token的KV访问,且不增加总KV存储。实验表明NAMOH在相同总参数下优于全激活模型,并在匹配活跃参数时比更小稠密模型更高效地支持长上下文推理。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Computation and Language
    NAMOH:通过激活部分注意力头实现原生稀疏注意力以扩展参数与上下文

    NAMOH 是一种架构原生稀疏注意力机制,每个 token 仅激活 H 个头中的 K 个,每个头只在其分配的 token 子序列上执行因果注意力。增加 H 同时固定 K 可缩短每个头的历史、减少每 token 的 KV 访问,且不增加总 KV 存储。实验表明 NAMOH 在相同总参数下优于全激活模型,并在匹配活跃参数时比更小稠密模型更高效地支持长上下文推理。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。