热点事件持续更新
PROMO:偏好条件多目标强化学习用于四足机器人
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
PROMO 将四足机器人运动控制的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下 67 个行为帕累托非支配,平均偏好-目标相关性 0.843;零样本迁移 Unitree Go2 后,仅改变偏好相对平衡偏好降低能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 12:00
代码与视频已开源。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv · RoboticsPROMO:偏好条件多目标强化学习用于四足机器人
PROMO 将四足机器人运动控制中的多目标权衡转为部署时的显式偏好输入,单一策略即可实现目标特化与鲁棒性。模拟中 100 个采样偏好下有 67 个行为在帕累托意义上非支配,平均偏好-目标相关性 0.843;策略零样本迁移到 Unitree Go2 后,仅改变偏好就能相对平衡偏好降低特定能耗 30.4%、位置误差 38.7%、峰值姿态偏差 59.0%。代码与视频已开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。