arXiv · Computer Vision· Aditya Sharma, Divya Saxena·· 5 小时前AI 评分34
同一几何结构,不同结果:视觉-语言模型中模态差距的读出依赖效应
One Geometry, Different Outcomes: Readout-Dependent Effects of the Modality Gap in Vision-Language Models
AI 导读
CLIP 与 SigLIP 编码器中存在单一主导方向,捕获图像-文本均值分离平方范数的 94.4-99.9%,表明均值分离分量近似秩一。
来源:arXiv · Computer Vision · arxiv.org