跳到正文
原文
arXiv · Statistics Machine Learning· Michael Kirchhof, Eleonora Gualdoni, Andrew Szot, Khashayar Gatmiry, Aryo Lotfi, Abbas Kazerouni, Omar Attia, Sanjoy Chowdhury, Alexander Toshev·· 7 小时前AI 评分50

RLTL;DR:通过内化自生成反馈实现自我改进

RLTL;DR: Self-improvement by Internalizing Self-generated Feedback

AI 导读

RLTL;DR 在每次失败后让策略根据验证器输出生成 TL;DR 反馈,并将所有历史洞察串联作为后续 rollout 条件,同时通过反向传播内化任务到洞察的映射。

来源:arXiv · Statistics Machine Learning · arxiv.org