Skip to content
arXiv · Machine Learning Theory· Ryan Solgi, Parsa Madinei, Zheng Zhang·· 4 hr agoAI score32

Tucker Bottleneck Attention(TuBA)用于多维序列建模

Tucker Bottleneck Attention for Multi-Dimensional Sequence Modeling

AI brief

论文提出 Tucker bottleneck attention(TuBA),利用低秩张量结构实现高效全局 token 混合,将隐藏张量投影到紧凑 Tucker 核上进行多头自注意力与线性投影,实现亚二次计算。

Source: arXiv · Machine Learning Theory · arxiv.org