跳到正文
原文
arXiv · Robotics· Yuchen Zhu, Chenyi Xu, Yulin Zhang, Gang Xu, Wentao Zhu·· 4 小时前AI 评分39

Juno:驯服视觉-语言-动作模型的预测潜变量

Juno: Taming Predictive Latents for Vision-Language-Action Models

AI 导读

研究者提出 Juno,一个围绕动作条件 JEPA 构建的统一框架,用作控制对齐的表征骨干、预测教师和可适配动力学模型。它在预训练阶段采用动态 CLS 损失,在策略学习阶段通过解耦推理分支蒸馏未来潜状态,部署时用 LoRA 适配器在全部观测转移(含失败 rollout)上适配世界模型。

来源:arXiv · Robotics · arxiv.org