Skip to content
arXiv · Machine Learning Theory· Junwei Quan, Evgenii Opryshko, Nicholas Rhinehart, Igor Gilitschenski·· 4 hr agoAI score33

World-Model Policy Arbiter:面向目标条件强化学习的策略仲裁框架

World-Model Policy Arbiter for Goal-Conditioned Reinforcement Learning

AI brief

论文提出 World-Model Policy Arbiter(WMPA),一种测试时框架,把一组冻结的目标条件策略当作组合,在学习的状态空间世界模型中 rollout 各策略,用共享的目标条件价值函数评估想象未来,并在每轮仲裁中执行得分最高策略一段承诺区间。

Source: arXiv · Machine Learning Theory · arxiv.org