跳到正文
原文
arXiv · Robotics· Amr Mousa, Rifny Rachman, Neil Karavis, Michele Caprio, Richard Allmendinger·· 3 小时前AI 评分42

PROMO:偏好条件多目标强化学习用于四足机器人

PROMO: Preference-conditioned Multi-Objective Reinforcement Learning for Quadrupedal Robots

AI 导读

PROMO 将四足机器人运动控制中的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下有 67 个行为在帕累托意义上非支配,平均偏好-目标相关性 0.843;策略零样本迁移到 Unitree Go2 后,仅改变偏好就能相对平衡偏好降低特定能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。

来源:arXiv · Robotics · arxiv.org