Skip to content
arXiv · Artificial Intelligence· Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei·· 4 hr agoAI score39

Rationale-Guided Policy Optimization:用自适应理由脚手架学习推理

Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding

AI brief

研究者提出 Rationale-Guided Policy Optimization(RGPO)框架,按模型当前能力自适应利用 ground-truth 理由信息,同时保留探索自由。

Source: arXiv · Artificial Intelligence · arxiv.org