跳到正文
热点事件持续更新

多模态强化学习中的持续感知信用分配与情感推理新方法

2 篇报道2 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30,arXiv同时发布两篇相关研究。第一篇指出Qwen2.5-VL-7B在四组多模态推理基准中27.81%的正确答案包含图像不支持的直接视觉断言,RLVR的结果级奖励使其继承正信用;固定回放反事实诊断显示DAPO与VPPO虽提升EFS但仍存在SPD现象,GRPO仅提升EFS。第二篇提出DSPO框架,通过DEDR与CVIG分别增强主观情感覆盖与视觉grounding,以改善情感推理的鲁棒性。两篇均聚焦多模态RL中的感知-决策耦合问题,但切入角度不同。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展
  1. 9月30日 12:00 · 1 篇报道
    视觉敏感性与可撤回性不等价:面向多模态强化学习的持续感知信用分配
    arXiv · Artificial Intelligence:视觉敏感性与可撤回性不等价:面向多模态强化学习的持续感知信用分配
  2. 9月30日 12:00 · 1 篇报道
    DSPO:面向鲁棒情感推理的多样性感知主观策略优化
    arXiv · Computer Vision:DSPO:面向鲁棒情感推理的多样性感知主观策略优化

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Artificial Intelligence
    视觉敏感性与可撤回性不等价:面向多模态强化学习的持续感知信用分配

    Qwen2.5-VL-7B 在四组多模态推理基准中 27.81% 的正确答案包含图像不支持的直接视觉断言,RLVR 因结果级奖励使这些断言继承正信用。研究提出固定回放反事实诊断,揭示 DAPO 与 VPPO 下 EFS 提升但断言的持续性强化的 SPD 现象,而 GRPO 仅提升 EFS。

  2. arXiv · Computer Vision
    DSPO:面向鲁棒情感推理的多样性感知主观策略优化

    DSPO 是一种针对多模态大语言模型情感推理的强化学习框架,通过 Distribution-Aligned Emotional Diversity Reward(DEDR)和 Counterfactual Visual Intervention Gating(CVIG)分别提升主观情感覆盖与视觉 grounding。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。