arXiv · Artificial Intelligence· Arip Asadulaev, Aladin Djuhera, Karim Salta, Holger Boche, Fakhri Karray, Martin Takac·· 16 小时前AI 评分46
Tropical Reinforcement Learning:用热带半环改进大语言模型的组合推理
Tropical Reinforcement Learning
AI 导读
论文提出 Tropical Reinforcement Learning,把传统期望回报中对成功轨迹概率求和改为取最大值(热带半环),让状态价值等于最可能已验证解的对数概率并保留可重放路径,从而支持跨 rollout 的前缀与后缀组合。
来源:arXiv · Artificial Intelligence · arxiv.org