跳到正文
原文
arXiv · Computer Vision· Ziyi Yin, Sangmin Woo, Kang Zhou, Sungyeon Kim, Aosong Feng, Haibo Ding, Jun Huan·· 5 小时前AI 评分42

StructRL:面向长时序视觉-语言-动作任务的在线结构化强化学习

StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

AI 导读

StructRL 是一种在线 RL 框架,将长时序 VLA 任务分解为可验证的子任务,在前置子任务完成后才给予中间奖励,并按完成节奏缩放奖励。在 RoboCasa365 和 LIBERO-Long 上,基于 GR00T-N1.5 和 pi 0.5 的实验中,StructRL 一致优于已评估的在线 RL 基线。代码已开源。

来源:arXiv · Computer Vision · arxiv.org