arXiv · Computer Vision· Raja Kumar, Rajat Koner, Ritwick Chaudhry, Zhuowei Li, Nishant Sankaran, Yifan Xing·· 3 小时前AI 评分35
SPLIT-RL:分阶段感知-语言推理训练与声明级优势
SPLIT-RL: Staged Perception-Language Reasoning Training with Claim-Level Advantages
AI 导读
SPLIT-RL 是一种分阶段后训练方法,将视觉推理(VR)与语言推理(LR)拆分到不同阶段训练,并用声明级优势(CLA-GRPO)在 VR 阶段对原子视觉声明提供细粒度优势。
来源:arXiv · Computer Vision · arxiv.org