跳到正文
原文
arXiv · Computer Vision· Aditya Sharma, Divya Saxena·· 5 小时前AI 评分34

同一几何结构,不同结果:视觉-语言模型中模态差距的读出依赖效应

One Geometry, Different Outcomes: Readout-Dependent Effects of the Modality Gap in Vision-Language Models

AI 导读

CLIP 与 SigLIP 编码器中存在单一主导方向,捕获图像-文本均值分离平方范数的 94.4-99.9%,表明均值分离分量近似秩一。

来源:arXiv · Computer Vision · arxiv.org