Berkeley AI Research·· 2025-11-01精选AI 评分62
无需 TD 学习的强化学习:分治范式与 Transitive RL
RL without TD learning
AI 导读
Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。
推荐理由
提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。
来源:Berkeley AI Research · bair.berkeley.edu