arXiv · Robotics· Haoyu Wang, Siyuan Qian, Yanjun Li, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang·· 3 小时前AI 评分38
DexPolicy:通过调度探索实现轨迹引导的灵巧操作
DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation
AI 导读
DexPolicy 将探索尺度显式建模为训练步数的函数,在保持损失、架构、奖励和优化器设置不变的前提下,从宽探索退火到窄探索。在 ViViDex 基准的五个 YCB 物体上,FPO 的确定性 Target 成功率从 49.4% 提升到 68.1%,GRPO 从 14.1% 提升到 45.4%,PPO 从 32.0% 提升到 35.7%。
来源:arXiv · Robotics · arxiv.org