Skip to content
arXiv · Computer Vision· Kim-Cuc Nguyen, Ngai-Man Cheung·· 4 hr agoAI score26

解析 Vision Transformer 的表征结构:一项严格的架构研究

Dissecting Representation Structure in Vision Transformers: A Rigorous Architectural Study

AI brief

该研究对不同架构规模下的特征信息进行了严格分析,揭示 ViT 表征与泛化行为的关系,并用于指导高效 ViT 设计。研究提出初始化特征坍缩的缓解方案,用熵与最小特征值量化特征信息,并发现 token 空间特征比嵌入空间更忠实、线性子模块特征对泛化预测至关重要。所提代理指标较先前基线将相关性排序提升 18-48%,可识别在更低或相当计算成本下取得更高准确率的 ViT 架构。

Source: arXiv · Computer Vision · arxiv.org