arXiv · Computer Vision· Mengping Dong, Jinbao Li, Fei Li·· 4 hr agoAI score24
DiscoVL:通过正交对抗正则化揭示视觉-语言模型的解耦跨模态表示学习
DiscoVL: Unveiling Disentangled C ross-Modal Representation Learning via Orthogonal Adversarial Regularization for V ision-Language Models
AI brief
研究提出 DiscoVL,一个面向视觉-语言模型的解耦跨模态表示学习框架,将正交对抗正则化与结构化跨模态对齐相结合。框架采用多分支低秩残差对齐器,把表示分解到子空间并在每层实现视觉与文本流的双向跨模态反馈,同时设计正交正则化对抗三元组损失以防止质心坍缩。
Source: arXiv · Computer Vision · arxiv.org