跳到正文
热点事件持续更新

PROMO:偏好条件多目标强化学习用于四足机器人

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

PROMO 将四足机器人运动控制的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下 67 个行为帕累托非支配,平均偏好-目标相关性 0.843;零样本迁移 Unitree Go2 后,仅改变偏好相对平衡偏好降低能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。

AI 根据报道生成 · 1 小时前更新

最新进展10月2日 12:00
代码与视频已开源。

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Robotics
    PROMO:偏好条件多目标强化学习用于四足机器人

    PROMO 将四足机器人运动控制中的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下有 67 个行为在帕累托意义上非支配,平均偏好-目标相关性 0.843;策略零样本迁移到 Unitree Go2 后,仅改变偏好就能相对平衡偏好降低特定能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。