跳到正文
原文
arXiv · Robotics· Dehao Huang, Jianbang Liu, Jianpan Gao, Chao Tang, Zilang Cen, Zedong Dan, Jiaheng Wang, Tingguang Li, Yue Wang, Hong Zhang·· 3 小时前AI 评分36

eRLT:通过动作相关 Token 路由实现高效 VLA 强化学习

eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing

AI 导读

eRLT 通过在冻结 VLA 的 tokens 和层之间路由任务相关动作信息,构建有效状态表示,提升机器人操作强化学习样本效率。路由模块由专家演示初始化,再通过在线交互的 critic 反馈优化。

来源:arXiv · Robotics · arxiv.org