arXiv · Robotics· Aditya Ramabadran, Simon Mahns, Tobias Gessler·· 2 小时前精选AI 评分78
DrivingBench:视觉语言模型能否驾驶丰田卡罗拉?
DrivingBench: Can Vision-Language Models Drive a Toyota Corolla?
AI 导读
研究团队发布 DrivingBench 基准,要求通用视觉语言模型通过摄像头画面直接控制丰田卡罗拉的转向和速度完成停车场锥桶路线。测试 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6,Astra 在第二次尝试时完成全程,其他模型均未超过 50%;该基准强调推理延迟、监控与恢复能力,并公开了工具、提示词、地图与视频遥测数据。
推荐理由
论文构建了真实车辆驾驶基准并给出可复现工具链,读者可借此评估主流视觉语言模型在具身控制任务上的实际能力边界。
来源:arXiv · Robotics · arxiv.org