arXiv · Computer Vision· Janet Wang, Yunbei Zhang, Xiao Wang, Jihun Hamm·· 7 小时前AI 评分55
医学 VLM 如何低利用视觉编码器:皮肤病学视角
How Medical VLMs Underutilize Their Vision Encoders: A Dermatology Perspective
AI 导读
研究发现医学 VLM 的视觉编码器强于端到端模型:MedSigLIP 比 MedGemma 平均高 10.26 个百分点。describe-then-decide 提示可将视觉注意力提升 30-40%,结合无标注提示与低标注编码器重排可在冻结 VLM 的前提下改善皮肤病学分类。
来源:arXiv · Computer Vision · arxiv.org