跳到正文
原文
arXiv · Artificial Intelligence· Hoang Phan, Minh Pham, Chau Pham, Chinmay Hegde, Trung Le, Qi Lei·· 3 小时前AI 评分39

Rationale-Guided Policy Optimization:用自适应理由脚手架学习推理

Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding

AI 导读

研究者提出 Rationale-Guided Policy Optimization(RGPO)框架,按模型当前能力自适应利用 ground-truth 理由信息,同时保留探索自由。

来源:arXiv · Artificial Intelligence · arxiv.org