Hot eventLive
PROMO:偏好条件多目标强化学习用于四足机器人
1 reports1 sources3 hr ago updated
Get the story
AI overview
PROMO 将四足机器人运动控制的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下 67 个行为帕累托非支配,平均偏好-目标相关性 0.843;零样本迁移 Unitree Go2 后,仅改变偏好相对平衡偏好降低能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。
Generated from reports · updated 2 hr ago
LatestOct 2
代码与视频已开源。Timeline
Follow the coverage from different angles.
Oct 2, 2026
- arXiv · RoboticsPROMO:偏好条件多目标强化学习用于四足机器人
PROMO 将四足机器人运动控制中的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下有 67 个行为在帕累托意义上非支配,平均偏好-目标相关性 0.843;策略零样本迁移到 Unitree Go2 后,仅改变偏好就能相对平衡偏好降低特定能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。
Heat trend
There is not enough continuous observation data to draw a trend yet.