arXiv · Computation and Language· Monika Shah, Sudarshan Balaji, Somdeb Sarkhel, Sanorita Dey, Deepak Venugopal·· 16 小时前AI 评分27
基于合作原则评估视觉语言模型的 VQA 性能
Evaluating VQA in Vision Language Models using Cooperative Principles
AI 导读
研究用 VLM 生成违反 Grice 准则的问题修饰语(非必要、歧义或虚假信息),评测 ChatGPT、Claude、Gemini 和 Llava 的 VQA 性能,发现违规存在时这些模型表现下降。实验进一步对比人类与 VLM 的语用推理差异:人类处理 VLM 引发的违规认知负荷更低,但 VLM 在此类情况下准确率反而更差。
来源:arXiv · Computation and Language · arxiv.org