arXiv · Human-Computer Interaction· Ziyi Wang, Qizan Guo, Rishitosh Singh, Xiyang Hu·· 3 小时前AI 评分30
VLMs 能否从游戏视频中理解人类参与度?
Do Vision Language Models Understand Human Engagement in Games?
AI 导读
研究使用 GameVibe Few-Shot 数据集评估三个 VLM 在九款第一人称射击游戏中的参与度推断能力。零样本预测普遍较弱,常不及多数类基线;检索增强提示可改善逐点预测,但成对预测始终困难。理论引导提示未能可靠提升表现,结果表明当前 VLMs 存在感知与理解之间的差距。
来源:arXiv · Human-Computer Interaction · arxiv.org