跳到正文
原文
arXiv · Artificial Intelligence· Arip Asadulaev, Aladin Djuhera, Karim Salta, Holger Boche, Fakhri Karray, Martin Takac·· 16 小时前AI 评分46

Tropical Reinforcement Learning:用热带半环改进大语言模型的组合推理

Tropical Reinforcement Learning

AI 导读

论文提出 Tropical Reinforcement Learning,把传统期望回报中对成功轨迹概率求和改为取最大值(热带半环),让状态价值等于最可能已验证解的对数概率并保留可重放路径,从而支持跨 rollout 的前缀与后缀组合。

来源:arXiv · Artificial Intelligence · arxiv.org