跳到正文
原文
arXiv · Artificial Intelligence· Hanyu Wang, Nakul Agarwal, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Makoto Fukushima, Jinghui Chen, Vaishnav Tadiparthi·· 3 小时前AI 评分33

推理 RL 轨迹展开中参考引导与自由生成的平衡

Balancing Reference Guidance and Free Generation in Trajectory Rollouts for Reasoning RL

AI 导读

论文提出 Adaptive Reference Guidance(ARG),在固定生成预算内构造正确轨迹,并应用于 Group Relative Policy Optimization(GRPO)的全失败组。

来源:arXiv · Artificial Intelligence · arxiv.org