跳到正文
原文
arXiv · Robotics· Yiqi Tang, Diyuan Shi, Runze Li, Donglin Wang·· 7 小时前AI 评分42

PreferenceFlow:通过人类干预引导冻结流匹配机器人策略

PreferenceFlow: Test-Time Guidance of Flow-Matching Robot Policies from Human Interventions

AI 导读

PreferenceFlow 在测试时通过人类干预改进预训练流匹配策略,无需环境奖励或更新基线策略。人类干预片段与机器人片段配对训练偏好模型,推理时用 QGF 采样更新,以偏好梯度替代价值梯度,并辅以梯度惩罚和零梯度损失。在 Franka 机器人四项真实精密插入任务中,成功率从基线 69% 提升至 90.5%。

来源:arXiv · Robotics · arxiv.org