arXiv · Computer Vision· Tianhui Cai, Xinglong Sun, Chao Fang, Zhenxin Li, Rui Song, Jose M. Alvarez, Yunxiang Mao, Jiaqi Ma, Langechuan Liu·· 4 hr agoAI score28
AffordDrive3D:具备空间理解的可供性感知世界-动作模型
AffordDrive3D: Affordance-Aware World-Action Modeling with Spatial Understanding
AI brief
AffordDrive3D 是一个可供性与几何感知的世界-动作模型,联合学习未来动作相关区域与空间结构。该模型基于 VLM 骨干网络,预测可行驶区域与碰撞关键区域,并从 RGB 世界模型潜变量预测未来几何结构。在 NAVSIM 上,AffordDrive3D 取得 91.3 PDMS 与 89.9 EPDMS 的 state-of-the-art 性能。
Source: arXiv · Computer Vision · arxiv.org