arXiv · Machine Learning Theory· Ryan Solgi, Parsa Madinei, Zheng Zhang·· 4 hr agoAI score32
Tucker Bottleneck Attention(TuBA)用于多维序列建模
Tucker Bottleneck Attention for Multi-Dimensional Sequence Modeling
AI brief
论文提出 Tucker bottleneck attention(TuBA),利用低秩张量结构实现高效全局 token 混合,将隐藏张量投影到紧凑 Tucker 核上进行多头自注意力与线性投影,实现亚二次计算。
Source: arXiv · Machine Learning Theory · arxiv.org