跳到正文
原文
arXiv · Computation and Language· Sumin Hong, Katsumi Ibaraki, Renee Shi, David Chiang, Toby Jia-Jun Li·· 6 小时前AI 评分28

跨模态关联中人类与视觉语言模型的注视差异研究

Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models

AI 导读

研究比较了人类(N=53)与多个视觉语言模型在跨模态关联任务中的选择与注视模式,发现较大 VLMs 在选择上与人类一致,但其显著性图与人类注视的匹配度不如中心高斯基线。微调小 VLMs 可使其选择对齐达到人类多数投票参考水平,但注视仍不及基线;仅训练模型注视可提升注视相关性,却不改善选择对齐。

来源:arXiv · Computation and Language · arxiv.org