跳到正文
原文
arXiv · Robotics· Yuto Tanaka, Kyo Kutsuzawa, Martina Doku, Dai Owaki, Mitsuhiro Hayashibe·· 3 小时前AI 评分35

SynIL:基于协同机制的离线模仿学习框架

SynIL: Leveraging Synergy for Offline Imitation Learning from Imperfect Demonstration Datasets

AI 导读

SynIL 提出一种自动化、无标注的演示质量评估方法,利用运动协同性量化生成密集转移级奖励信号,在 D4RL locomotion 和 Robomimic 多人类操作数据集上评估。该方法与真实奖励强相关,大幅优于 Behavior Cloning,在稀疏奖励遥操作场景下性能超越基于真实环境奖励的离线强化学习。

来源:arXiv · Robotics · arxiv.org