跳到正文
原文
arXiv · Computer Vision· Tianhui Cai, Xinglong Sun, Chao Fang, Zhenxin Li, Rui Song, Jose M. Alvarez, Yunxiang Mao, Jiaqi Ma, Langechuan Liu·· 3 小时前AI 评分28

AffordDrive3D:具备空间理解的可供性感知世界-动作模型

AffordDrive3D: Affordance-Aware World-Action Modeling with Spatial Understanding

AI 导读

AffordDrive3D 是一个可供性与几何感知的世界-动作模型,联合学习未来动作相关区域与空间结构。该模型基于 VLM 骨干网络,预测可行驶区域与碰撞关键区域,并从 RGB 世界模型潜变量预测未来几何结构。在 NAVSIM 上,AffordDrive3D 取得 91.3 PDMS 与 89.9 EPDMS 的 state-of-the-art 性能。

来源:arXiv · Computer Vision · arxiv.org