Gemini Robotics ER 2 发布:赋能机器人视频理解、任务编排与多机器人协作
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
Robostral Navigate 是 Mistral AI 推出的8B具身导航模型,仅用单RGB相机在未见R2R-CE基准上达76.6%成功率,比多传感器方案高4.5分。模型完全自研、仅用仿真数据训练,借助前缀缓存将训练token减少22倍,再通过CISPO在线强化学习进一步提升3.2%成功率。
Gemini Robotics-ER 1.6 发布,增强空间推理、多视角理解与仪器读数能力,提升机器人在真实环境中的自主决策水平。该模型通过与 Boston Dynamics 合作发现仪器读数场景,利用 agentic vision 结合视觉推理与代码执行实现精确读数,并在安全性上为迄今最安全版本,在对抗性空间推理任务中优于前代。