跳到正文
原文
arXiv · Artificial Intelligence· Emile Anand, Abdullah Ateyeh, Archer Wang, Marin Solja\v{c}i\'c·· 5 小时前AI 评分38

SMat-Attention:结构化长上下文序列建模

SMat-Attention: Structured Long-Context Sequence Modeling

AI 导读

SMat-Attention 通过引入具有结构化长程路由的因果掩码族,将 VC 维数 d 作为控制访问模式复杂度、预填充成本和解码内存的显式旋钮。d=1 恢复标准因果掩码,增大 d 允许更丰富的子集路由模式;硬路由构造的预填充复杂度为 O(T^{2-3/d}+T),固定时间窗流式解码每 token 使用 O(T^{1-1/d}) 缓存状态实现常数时间。

来源:arXiv · Artificial Intelligence · arxiv.org