arXiv · Artificial Intelligence· Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei·· 4 hr agoAI score39
Rationale-Guided Policy Optimization:用自适应理由脚手架学习推理
Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding
AI brief
研究者提出 Rationale-Guided Policy Optimization(RGPO)框架,按模型当前能力自适应利用 ground-truth 理由信息,同时保留探索自由。
Source: arXiv · Artificial Intelligence · arxiv.org