对话一目科技:机器人还缺失的「手感」,我们用「光」来搞定
一目科技推出全球最薄可量产仿生视触觉传感器 SENTRA T0,厚度 3 毫米以下,指尖面积 24 万点分辨率、5mN 三维力精度、8ms 响应。公司以光触觉替代视触觉,用柔性材料形变和光学检测模拟人类触觉,目标是补齐具身智能感知瓶颈。创始人李智强认为机器人最大瓶颈是数据,触觉尚未电子化,应通过真机强化学习和仿真后训练积累手感,并推动 OpenTouch 和 TouchNet 等开源标准化。
一目科技推出全球最薄可量产仿生视触觉传感器 SENTRA T0,厚度 3 毫米以下,指尖面积 24 万点分辨率、5mN 三维力精度、8ms 响应。公司以光触觉替代视触觉,用柔性材料形变和光学检测模拟人类触觉,目标是补齐具身智能感知瓶颈。创始人李智强认为机器人最大瓶颈是数据,触觉尚未电子化,应通过真机强化学习和仿真后训练积累手感,并推动 OpenTouch 和 TouchNet 等开源标准化。
英国初创公司 Worldmodeldata 由 Yann LeCun 顾问,宣称已从游戏工作室获得近 100 万小时控制器输入与视觉配对数据,用于训练世界模型。
该研究提出受被动动态行走启发的框架,在早期训练中通过倾斜重力场辅助步态发现,无需参考轨迹或接触调度。在 Unitree G1(29-DoF)上的五组实验显示,机械运输成本降低 6.8-15.2%,全向行走结合运动先验后降低 18.7%,硬件上正向行走降低 16.3%。
CoVLM-Bench 包含 2,196 对帧、35,136 条协同驾驶问答标注和 3 秒内 6 个航路点的规划目标。CoVLM-Drive 直接使用车路配对视角进行问答与规划,FDE 低于对比的 V2X 规划器,问答初始化与理由监督各自降低规划误差。
summary_zh: 该综述系统梳理了机器人上下文学习(ICL)的四类接口:context-conditioned policies、geometric demonstration transfer、world-model-based control、skill- and agent-based execution。
SAKI 框架通过人类视频学习可复用的以物体为中心的技能,并在跨演示组装与闭环全身执行之间建立连接。系统根据目标与任务依赖选择并排序技能,绑定物体角色并在连续技能间保持场景估计与机器人配置。真实机器人实验验证了技能跨布局复用与独立演示技能的连续组合能力,消融实验表明任务条件化参考准备显著提升长时序任务完成率。
AMD宣布收购专注于世界模型的初创公司World Labs,AI先驱李飞飞将加入AMD担任执行副总裁兼首席科学家。该交易为全股票估值约82亿美元,预计2026年底前完成监管审批。
推荐理由:AMD以82亿美元收购空间智能初创公司World Labs,读者可借此观察AI芯片竞争格局与硬件-模型协同趋势。
summary_zh: 正行创新(Striding AI)联合创始人杨宇欣正式出任总裁,全面负责全球市场拓展、产业生态建设与商业化落地。他此前在黑芝麻智能担任首席市场营销官八年,亲历公司从首款产品发布到港股上市的全过程。
ChipAgents 发布 IC-STAR 自主芯片执行引擎,覆盖数字、模拟与 3D IC 的端到端自动化,加速 PPA 收敛。系统包含四项核心硅设计自主技术,需深度协同优化以保证可靠性。Ambiq 已部署该 agentic AI 加速物理 AI 系统芯片开发。
AMD正式官宣以全股票方式收购李飞飞创立两年的AI独角兽World Labs,作价约82亿美元,交易预计在2026年底前完成但仍须监管批准。李飞飞将出任AMD执行副总裁兼首席科学家,直接向CEO苏姿丰汇报,World Labs另外两位联合创始人Justin Johnson和Ben Mildenhall将继续带领团队。
推荐理由:AMD以全股票方式收购World Labs并让李飞飞直接向苏姿丰汇报,读者可以据此观察芯片巨头如何围绕空间智能与机器人仿真押注未来工作负载。
诺因智能宣布完成数亿元人民币天使+++轮融资,由京东相关基金领投,正心谷资本、南山战新投和华登投资跟投。公司自2025年8月成立以来已完成5轮融资,累计超10亿元。GLOW生成式具身大模型在RoboDojo 18项仿真任务中平均成功率62.2%,较GPT-6基线高出40个百分点;LIBERO-Pro评测中以86.7%位列单策略模型第一。
AMD 收购 World Labs,价格 82 亿美元。World Labs 自 2024 年成立以来构建了面向创意、设计和机器人模拟的 AI 空间智能能力,并发布 Atlas 模型,通过结合生成模型与多视角几何解决稀疏重建问题,实现新相机视角预测。应用领域包括机器人强化学习环境、场景生成以及房地产、设计和施工的真实世界重建。
Charlie Kemp 是 Hello Robot 联合创始人兼 CTO,开发用于家庭和工作场所的移动操作辅具机器人,重点服务老年人和行动障碍者。他与 Aaron Edsinger 共同创立 Hello Robot,此前在 MIT 参与 Cog 项目和 Domo 人形机器人研究,并与 Henry Evans 合作 Robots for Humanity 项目。
AMD 宣布以 82 亿美元收购世界模型公司 World Labs,创始人 Fei-Fei Li 将加入 AMD 担任执行副总裁兼首席科学家。World Labs 推出过面向娱乐与机器人训练模拟的 Marble 产品;交易预计年底前完成,待监管批准。
summary_zh: 特斯拉 Optimus 人形机器人因制造工艺不完善和手动装配密集,新产出的机器人需要立即修复。手部触觉传感器不可靠,特斯拉开发了可替换的手套式传感器层。
Microsoft Research 在 Physical AI Toolchain 中新增行业首个机器人推理卸载能力,可将 SO-101、UR10e 等机器人的推理从机载 GPU 卸载至边缘或云 GPU。实验显示,卸载改善了移动操作任务的成功率、响应精度和电池续航,并支持通过 Kubernetes 自动容器化与编排。
推荐理由:首次系统量化了机器人推理卸载的收益,为物理 AI 基础设施选型提供可对比的实测依据。
NVIDIA Isaac ROS 5.0在多伦多ROSCon发布,引入智能体工作流与GPU加速软件包,帮助人与AI智能体共同开发机器人。FoundationPose提供面向智能体的推理库,使机器人感知并跟踪物体位姿的速度最高可快5.5倍。新版支持ROS Lyrical和Ubuntu 24.04。
NVIDIA 推出全栈安全系统 Halos,覆盖 AV 与机器人从硬件、软件、AI 行为到部署生命周期的安全工程。Halos 整合 DRIVE AGX Thor、IGX Thor、Halos OS、Alpamayo、Isaac Lab 与 Omniverse,并提供可追溯的安全证据与第三方认证支持。
VicOne文章指出物理AI让机器人安全面临攻击者操控感知、决策和动作的新风险。传统功能安全关注故障,而网络安全关注恶意操控且系统可能仍看似正常。文章分三层分析:BadNets与BadVLA等攻击显示模型可能在隐藏触发条件下偏离行为;UniPwn等系统漏洞可导致无线入侵和指令覆盖;RoboPAIR、VLAttack等运行时操控可让机器人执行危险动作。
Google Research 在 CHI 2026 发表 AgentHands 原型,利用 XR 空间理解能力为 AI 智能体添加与语音同步的手部手势。系统包含环境感知、手势事件库、嵌入手势的推理和同步执行模块,在 12 人用户研究中相比纯语音基线显著提升了空间定位、复杂动作理解、安全提示效果并降低了认知负荷。
summary_zh: Google DeepMind 回顾十五年来从 Atari 到 EVE Online 的游戏 AI 研究,与 Fenris Creations 等游戏工作室合作开发 SIMA 多世界智能体。
阿尔托大学研究团队在超导电路中实现了世界上首台循环量子热引擎,结合 transmon 量子比特、谐振器与量子制冷机,在接近绝对零度的低温下完成奥托循环并输出正功。该装置利用单一可编程量子制冷机同时提供高温与低温热源,简化了系统结构。未来有望直接集成于超导电路中,减少大规模量子计算机对数百万条微波电缆的依赖,从而降低成本与噪声。
微软研究院的新基准 MindTopo 发现,专有与开放权重多模态模型在静态拓扑推理上明显强于交互规划,且都远低于人类。它按连续性、分离、顺序、包围和绳结五类,测试静态场景问答,以及模拟环境中须维持或改变关系的动作规划。规划失败常在理解场景之后出现,模型失去对结构关系的追踪,或提出违反环境约束的动作。
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
NVIDIA 发布 Cosmos-H-Dreams,一款基于单张 RTX PRO 6000 GPU 运行的手术机器人实时生成式仿真器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,通过 FlashDreams 推理库实现约 160 fps 的交互式操作,每潜在帧仅需 2 步去噪,支持 dVRK 桌面缝合任务,并可连接学习型手术策略形成闭环。
推荐理由:NVIDIA将手术世界模型压缩至单卡实时推理,使外科机器人策略的闭环评估与合成数据生成不再依赖稀缺物理硬件。
Grabette 是 Pollen Robotics 发布的开源手持采集设备,配合 Gripette 机械爪端,能用普通相机、IMU 和深度相机记录操作演示,并自动生成 LeRobot 格式的机器人就绪数据集。
推荐理由:原文给出了低成本的采集方案与开放数据集入口,读者可以据此判断它能否降低机器人学习的数据门槛。
Robostral Navigate 是 Mistral AI 推出的8B具身导航模型,仅用单RGB相机在未见R2R-CE基准上达76.6%成功率,比多传感器方案高4.5分。模型完全自研、仅用仿真数据训练,借助前缀缓存将训练token减少22倍,再通过CISPO在线强化学习进一步提升3.2%成功率。
NVIDIA推出ENPIRE框架,通过环境重置、策略改进、 rollout和进化四个模块,让机器人在真实世界中自主试错并迭代策略。测试显示前沿编码代理能在PushT、插GPU等任务上达到99%成功率,多代理并行可更快找到更优解,但机器人规模扩大后资源利用率会下降。
Google DeepMind Accelerator: Robotics 计划遴选 15 家欧洲早期机器人初创公司,提供 3 个月密集导师指导与技术支持,帮助将 AI 融入核心产品。入选公司覆盖物流、制造、医疗、气候与导航等领域,可使用 Google AI 栈、技术专长及 Gemini 机器人模型。
Google 在 Project Genie 中接入 Street View 真实街景图像,生成式世界模型可基于美国真实地点生成互动虚拟环境。该功能通过 Maps Imagery Grounding 技术实现,用户可选风格(如"Ocean World"、"B&W film")并描述角色,Genie 创建锚定真实街景的想象世界。
Gemini Robotics-ER 1.6 发布,增强空间推理、多视角理解与仪器读数能力,提升机器人在真实环境中的自主决策水平。该模型通过与 Boston Dynamics 合作发现仪器读数场景,利用 agentic vision 结合视觉推理与代码执行实现精确读数,并在安全性上为迄今最安全版本,在对抗性空间推理任务中优于前代。
大阪市立大学工学助理教授 Fujinaga 开发了一套结合图像识别与统计分析的"收获难易度估计"系统,训练机器人在采摘前评估每个番茄的难易程度。测试中成功率达 81%,约四分之一的成功采摘来自首次正面尝试失败后从侧面收获。该研究将"收获难易度"确立为可量化评估指标,推动机器人与人类协作的农业模式。
哥伦比亚工程团队在 Science Robotics 发表论文,首次构建能通过自学习和观察人类视频控制唇部运动的机器人。机器人利用 26 个面部电机,通过镜中自我探索和 YouTube 人类语音/歌唱视频学会多语言唇形同步,并演唱了 AI 生成专辑中的歌曲。研究指出唇部运动是恐怖谷的重要成因,结合对话 AI 后有望提升人机情感连接,但团队也承认伦理风险。
宾夕法尼亚大学与密歇根大学团队造出约 200×300×50 微米的全自主可编程机器人,可游泳、感知温度并自主决策,单个成本约一美分,由 LED 供光可持续运行数月。研究发表于 Science Robotics 与 PNAS,机器人通过电场驱动周围离子运动前进,配备完整处理器、内存与传感器,并能用跳舞抖动编码温度数据通过显微镜读取。