Skip to content
Hot eventLive

PROMO:偏好条件多目标强化学习用于四足机器人

1 reports1 sources3 hr ago updated

Get the story

AI overview

PROMO 将四足机器人运动控制的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下 67 个行为帕累托非支配,平均偏好-目标相关性 0.843;零样本迁移 Unitree Go2 后,仅改变偏好相对平衡偏好降低能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。

Generated from reports · updated 2 hr ago

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Robotics
    PROMO:偏好条件多目标强化学习用于四足机器人

    PROMO 将四足机器人运动控制中的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下有 67 个行为在帕累托意义上非支配,平均偏好-目标相关性 0.843;策略零样本迁移到 Unitree Go2 后,仅改变偏好就能相对平衡偏好降低特定能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。

Heat trend

There is not enough continuous observation data to draw a trend yet.