跳到正文
热点事件持续更新

StructRL: Online Structured RL for Long-Horizon VLA Tasks

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

StructRL 是一种面向长时序视觉-语言-动作(VLA)任务的在线强化学习框架。该方法将长时序任务分解为可验证的子任务,仅在前置子任务完成后才给予中间奖励,并按完成节奏缩放奖励。研究者在 RoboCasa365 和 LIBERO-Long 上进行了实验,基于 GR00T-N1.5 和 pi 0.5 模型,结果显示 StructRL 一致优于已评估的在线 RL 基线,相关代码已开源。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Computer Vision
    StructRL:面向长时序视觉-语言-动作任务的在线结构化强化学习

    StructRL 是一种在线 RL 框架,将长时序 VLA 任务分解为可验证的子任务,在前置子任务完成后才给予中间奖励,并按完成节奏缩放奖励。在 RoboCasa365 和 LIBERO-Long 上,基于 GR00T-N1.5 和 pi 0.5 的实验中,StructRL 一致优于已评估的在线 RL 基线。代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。