arXiv · Computation and Language· Ziyang Cheng, Yuhao Wang, Hongcheng Liu, Qimin Wu, Jingru Fan, Chen Qian, Yanfeng Wang, Yu Wang·· 16 小时前AI 评分52
论文提出以文本为中心的全模态推理后训练范式
Text-Centric Post-Training for Omni-Modal Reasoning
AI 导读
论文提出以文本为中心的全模态推理后训练范式,用文本训练主优化推理,再用减少数据的原生音视频 RL 精炼感知。文本-only SFT 加 RL 使 Qwen2.5-Omni-7B 九项推理分数几何均值较基线提升 25.83%,比完整原生音视频路线少 56.6% GPU-hours;精炼阶段输入 token 减少约 90%,感知恢复至基线以上,并保留文本-only 管线 93.5% 的推理增益。
来源:arXiv · Computation and Language · arxiv.org