arXiv · Statistics Machine Learning· Michael Kirchhof, Eleonora Gualdoni, Andrew Szot, Khashayar Gatmiry, Aryo Lotfi, Abbas Kazerouni, Omar Attia, Sanjoy Chowdhury, Alexander Toshev·· 7 小时前AI 评分50
RLTL;DR:通过内化自生成反馈实现自我改进
RLTL;DR: Self-improvement by Internalizing Self-generated Feedback
AI 导读
RLTL;DR 在每次失败后让策略根据验证器输出生成 TL;DR 反馈,并将所有历史洞察串联作为后续 rollout 条件,同时通过反向传播内化任务到洞察的映射。
来源:arXiv · Statistics Machine Learning · arxiv.org