arXiv · Artificial Intelligence· Ziquan Zhu, Hanruo Zhu, Si-Yuan Lu, Morris Yu-Chao Huang, Yicheng Lin, Wei Han, Tianlong Chen, Mingyuan Wu, Hanchao Yu, Gaojie Jin, Lu Liu, Bo Sun, Tianjin Huang·· 4 hr agoAI score35
VLM 何时该反思:MOTIVE 学习多视角自验证
When to Rethink: Learning Multi-Perspective Self-Verification for Vision-Language Models
AI brief
研究者提出 MOTIVE 框架,用多视角自验证与可靠性引导的选择性反思提升视觉语言模型(VLM)多模态推理的可靠性。MOTIVE 从互补验证视角评估候选答案,学习与正确性对齐的可靠性分数,在推理时据此决定直接接受还是触发历史引导的反思。实验显示其在多个多模态基准和 VLM 骨干上优于强自验证与自纠正基线,并减少不必要的推理轮次,无需外部评判。
Source: arXiv · Artificial Intelligence · arxiv.org