arXiv · Robotics· Tingting Du, Ziyao Wang, Guoheng Sun, Ang Li·· 16 小时前AI 评分35
XGenAct:通过跨任务生成实现几何增强的世界动作模型
XGenAct: Geometry-Enhanced World Action Models through Cross-Task Generation
AI 导读
研究者提出世界动作模型 XGenAct,将 RGB 观测、机器人动作、度量深度、表面法线和功能角色分割统一表示为 RGB 视频,用单一视频 diffusion transformer 和单一目标完成跨空间时序预测,无需模态专用头部。在 RLBench 留出任务上,其五任务外部比较成功率达 52%,强于最强基线的 26%,并更准确预测未来深度与分割。
来源:arXiv · Robotics · arxiv.org