arXiv · Machine Learning Theory· Junwei Quan, Evgenii Opryshko, Nicholas Rhinehart, Igor Gilitschenski·· 3 小时前AI 评分33
World-Model Policy Arbiter:面向目标条件强化学习的策略仲裁框架
World-Model Policy Arbiter for Goal-Conditioned Reinforcement Learning
AI 导读
论文提出 World-Model Policy Arbiter(WMPA),一种测试时框架,把一组冻结的目标条件策略当作组合,在学习的状态空间世界模型中 rollout 各策略,用共享的目标条件价值函数评估想象未来,并在每轮仲裁中执行得分最高策略一段承诺区间。
来源:arXiv · Machine Learning Theory · arxiv.org