arXiv · Computer Vision· Cheng Ye, Weidong Chen, Bingyan Xu, Zhendong Mao·· 6 小时前AI 评分35
DSPO:面向鲁棒情感推理的多样性感知主观策略优化
DSPO: Diversity-aware Subjective Policy Optimization for Robust Emotional Reasoning
AI 导读
DSPO 是一种针对多模态大语言模型情感推理的强化学习框架,通过 Distribution-Aligned Emotional Diversity Reward(DEDR)和 Counterfactual Visual Intervention Gating(CVIG)分别提升主观情感覆盖与视觉 grounding。
来源:arXiv · Computer Vision · arxiv.org