arXiv · Artificial Intelligence· Zhongan Bi, Kepeng Lin, Xuanang Gao, Yuhan Sun, Lianrun Zhang·· 6 小时前AI 评分42
视觉敏感性与可撤回性不等价:面向多模态强化学习的持续感知信用分配
Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning
AI 导读
Qwen2.5-VL-7B 在四组多模态推理基准中 27.81% 的正确答案包含图像不支持的直接视觉断言,RLVR 因结果级奖励使这些断言继承正信用。研究提出固定回放反事实诊断,揭示 DAPO 与 VPPO 下 EFS 提升但断言的持续性强化的 SPD 现象,而 GRPO 仅提升 EFS。
来源:arXiv · Artificial Intelligence · arxiv.org