跳到正文
原文
arXiv · Robotics· Tingting Du, Ziyao Wang, Guoheng Sun, Ang Li·· 16 小时前AI 评分35

XGenAct:通过跨任务生成实现几何增强的世界动作模型

XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation

AI 导读

研究者提出世界动作模型 XGenAct,将 RGB 观测、机器人动作、度量深度、表面法线和功能角色分割统一表示为 RGB 视频,用单一视频 diffusion transformer 和单一目标完成跨空间时序预测,无需模态专用头部。在 RLBench 留出任务上,其五任务外部比较成功率达 52%,强于最强基线的 26%,并更准确预测未来深度与分割。

来源:arXiv · Robotics · arxiv.org