跳到正文

#具身智能

今日 7 条
今天9月30日周三
  1. 爱范儿62

    对话一目科技:机器人还缺失的「手感」,我们用「光」来搞定

    一目科技推出全球最薄可量产仿生视触觉传感器 SENTRA T0,厚度 3 毫米以下,指尖面积 24 万点分辨率、5mN 三维力精度、8ms 响应。公司以光触觉替代视触觉,用柔性材料形变和光学检测模拟人类触觉,目标是补齐具身智能感知瓶颈。创始人李智强认为机器人最大瓶颈是数据,触觉尚未电子化,应通过真机强化学习和仿真后训练积累手感,并推动 OpenTouch 和 TouchNet 等开源标准化。

  2. arXiv · Robotics42

    SAKI:基于人类视频的技能组装与运动学模仿,用于长时序移动操作

    SAKI 框架通过人类视频学习可复用的以物体为中心的技能,并在跨演示组装与闭环全身执行之间建立连接。系统根据目标与任务依赖选择并排序技能,绑定物体角色并在连续技能间保持场景估计与机器人配置。真实机器人实验验证了技能跨布局复用与独立演示技能的连续组合能力,消融实验表明任务条件化参考准备显著提升长时序任务完成率。

9月29日周二
  1. 爱范儿80

    AMD 82亿美元收购李飞飞World Labs,李飞飞出任AMD执行副总裁兼首席科学家

    AMD正式官宣以全股票方式收购李飞飞创立两年的AI独角兽World Labs,作价约82亿美元,交易预计在2026年底前完成但仍须监管批准。李飞飞将出任AMD执行副总裁兼首席科学家,直接向CEO苏姿丰汇报,World Labs另外两位联合创始人Justin Johnson和Ben Mildenhall将继续带领团队。

    推荐理由:AMD以全股票方式收购World Labs并让李飞飞直接向苏姿丰汇报,读者可以据此观察芯片巨头如何围绕空间智能与机器人仿真押注未来工作负载。

  2. 量子位72

    诺因智能完成数亿元天使+++轮融资,累计超10亿元

    诺因智能宣布完成数亿元人民币天使+++轮融资,由京东相关基金领投,正心谷资本、南山战新投和华登投资跟投。公司自2025年8月成立以来已完成5轮融资,累计超10亿元。GLOW生成式具身大模型在RoboDojo 18项仿真任务中平均成功率62.2%,较GPT-6基线高出40个百分点;LIBERO-Pro评测中以86.7%位列单策略模型第一。

  3. Latent Space69

    AMD 以 82 亿美元收购 World Labs,Atlas 解决稀疏重建问题

    AMD 收购 World Labs,价格 82 亿美元。World Labs 自 2024 年成立以来构建了面向创意、设计和机器人模拟的 AI 空间智能能力,并发布 Atlas 模型,通过结合生成模型与多视角几何解决稀疏重建问题,实现新相机视角预测。应用领域包括机器人强化学习环境、场景生成以及房地产、设计和施工的真实世界重建。

9月26日周六
9月24日周四
  1. Microsoft Research67

    Microsoft Research 发布 Physical AI Toolchain 推理卸载功能

    Microsoft Research 在 Physical AI Toolchain 中新增行业首个机器人推理卸载能力,可将 SO-101、UR10e 等机器人的推理从机载 GPU 卸载至边缘或云 GPU。实验显示,卸载改善了移动操作任务的成功率、响应精度和电池续航,并支持通过 Kubernetes 自动容器化与编排。

    推荐理由:首次系统量化了机器人推理卸载的收益,为物理 AI 基础设施选型提供可对比的实测依据。

9月22日周二
9月17日周四
  1. IEEE Spectrum · AI58

    重新思考AI时代的机器人安全

    VicOne文章指出物理AI让机器人安全面临攻击者操控感知、决策和动作的新风险。传统功能安全关注故障,而网络安全关注恶意操控且系统可能仍看似正常。文章分三层分析:BadNets与BadVLA等攻击显示模型可能在隐藏触发条件下偏离行为;UniPwn等系统漏洞可导致无线入侵和指令覆盖;RoboPAIR、VLAttack等运行时操控可让机器人执行危险动作。

8月26日周三
  1. Google Research52

    AgentHands:为 XR 中基于空间的智能体对话生成交互式手部手势

    Google Research 在 CHI 2026 发表 AgentHands 原型,利用 XR 空间理解能力为 AI 智能体添加与语音同步的手部手势。系统包含环境感知、手势事件库、嵌入手势的推理和同步执行模块,在 12 人用户研究中相比纯语音基线显著提升了空间定位、复杂动作理解、安全提示效果并降低了认知负荷。

8月21日周五
8月14日周五
  1. ScienceDaily · AI22

    世界上首台超导量子热引擎问世,或助力大规模量子计算机发展

    阿尔托大学研究团队在超导电路中实现了世界上首台循环量子热引擎,结合 transmon 量子比特、谐振器与量子制冷机,在接近绝对零度的低温下完成奥托循环并输出正功。该装置利用单一可编程量子制冷机同时提供高温与低温热源,简化了系统结构。未来有望直接集成于超导电路中,减少大规模量子计算机对数百万条微波电缆的依赖,从而降低成本与噪声。

8月13日周四
  1. Microsoft Research44

    MindTopo 揭示 VLM 的空间推理能力

    微软研究院的新基准 MindTopo 发现,专有与开放权重多模态模型在静态拓扑推理上明显强于交互规划,且都远低于人类。它按连续性、分离、顺序、包围和绳结五类,测试静态场景问答,以及模拟环境中须维持或改变关系的动作规划。规划失败常在理解场景之后出现,模型失去对结构关系的追踪,或提出违反环境约束的动作。

7月30日周四
  1. Google DeepMind66

    Gemini Robotics ER 2 发布:赋能机器人视频理解、任务编排与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。

    推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。

7月28日周二
  1. Google DeepMind64

    Gemini Robotics 2 带来机器人的全身体智能

    Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。

    推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。

7月27日周一
  1. Hugging Face Blog64

    NVIDIA 发布 Cosmos-H-Dreams:实现手术机器人实时生成式仿真

    NVIDIA 发布 Cosmos-H-Dreams,一款基于单张 RTX PRO 6000 GPU 运行的手术机器人实时生成式仿真器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,通过 FlashDreams 推理库实现约 160 fps 的交互式操作,每潜在帧仅需 2 步去噪,支持 dVRK 桌面缝合任务,并可连接学习型手术策略形成闭环。

    推荐理由:NVIDIA将手术世界模型压缩至单卡实时推理,使外科机器人策略的闭环评估与合成数据生成不再依赖稀缺物理硬件。

7月21日周二
  1. Hugging Face Blog72

    Grabette:开源手持设备记录机器人操作数据

    Grabette 是 Pollen Robotics 发布的开源手持采集设备,配合 Gripette 机械爪端,能用普通相机、IMU 和深度相机记录操作演示,并自动生成 LeRobot 格式的机器人就绪数据集。

    推荐理由:原文给出了低成本的采集方案与开放数据集入口,读者可以据此判断它能否降低机器人学习的数据门槛。

7月8日周三
6月29日周一
6月9日周二
5月18日周一
4月13日周一
  1. Google DeepMind55

    Gemini Robotics-ER 1.6 发布,通过增强的具身推理赋能真实机器人任务

    Gemini Robotics-ER 1.6 发布,增强空间推理、多视角理解与仪器读数能力,提升机器人在真实环境中的自主决策水平。该模型通过与 Boston Dynamics 合作发现仪器读数场景,利用 agentic vision 结合视觉推理与代码执行实现精确读数,并在安全性上为迄今最安全版本,在对抗性空间推理任务中优于前代。

3月18日周三
  1. ScienceDaily · AI36

    AI 机器人学习更高效地采摘番茄

    大阪市立大学工学助理教授 Fujinaga 开发了一套结合图像识别与统计分析的"收获难易度估计"系统,训练机器人在采摘前评估每个番茄的难易程度。测试中成功率达 81%,约四分之一的成功采摘来自首次正面尝试失败后从侧面收获。该研究将"收获难易度"确立为可量化评估指标,推动机器人与人类协作的农业模式。

1月16日周五
  1. ScienceDaily · AI62

    哥伦比亚工程团队让机器人学会唇部运动以减少恐怖谷感

    哥伦比亚工程团队在 Science Robotics 发表论文,首次构建能通过自学习和观察人类视频控制唇部运动的机器人。机器人利用 26 个面部电机,通过镜中自我探索和 YouTube 人类语音/歌唱视频学会多语言唇形同步,并演唱了 AI 生成专辑中的歌曲。研究指出唇部运动是恐怖谷的重要成因,结合对话 AI 后有望提升人机情感连接,但团队也承认伦理风险。

1月6日周二
  1. ScienceDaily · AI60

    宾大与密歇根大学研发出比盐粒更小的可编程自主机器人

    宾夕法尼亚大学与密歇根大学团队造出约 200×300×50 微米的全自主可编程机器人,可游泳、感知温度并自主决策,单个成本约一美分,由 LED 供光可持续运行数月。研究发表于 Science Robotics 与 PNAS,机器人通过电场驱动周围离子运动前进,配备完整处理器、内存与传感器,并能用跳舞抖动编码温度数据通过显微镜读取。