无实体 AI 机器人手学会行走,能恢复平衡、按键盘并操控物体
工程师训练了一个无实体机器人手,使其能在手指上行走、从摔倒中恢复、按键盘按键并操控物体。演示展示了无需机械臂的情况下完成复杂操作的能力。
工程师训练了一个无实体机器人手,使其能在手指上行走、从摔倒中恢复、按键盘按键并操控物体。演示展示了无需机械臂的情况下完成复杂操作的能力。
Microsoft 重启 Surface Mouse,新增触觉反馈和可自定义操作按钮,售价 $80,将于 10 月 13 日上架。鼠标采用对称设计、支持蓝牙 5.0 配对多设备,并使用 30% 再生塑料。操作按钮主要配合 Copilot 使用,需通过 Microsoft Surface App 进行自定义。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为企业对话模型加上动态视觉形象,已在 Gemini Enterprise 上线。
推荐理由:原文给出实时视频形象与异步工具调用的能力说明,读者可据此了解企业智能体的交互形态变化。
WhisperX 扩展 OpenAI Whisper,加入逐词时间戳、说话人标注和批量推理,将原始音频转为结构化转录文本。AWS WhisperX Deep Learning Container 打包所有依赖,部署到 SageMaker 实时或异步端点,无需自定义镜像。
summary_zh: Amazon Bedrock AgentCore Gateway 与 Model Context Protocol(MCP)结合,让 AI Agent 在不复制或集中数据的前提下跨多个 AWS 账户查询。
Aderant 基于 Amazon Nova Lite 和 Amazon Bedrock 构建智能工单分诊系统,自动化上下文收集、分类、路由与知识增强。系统每小时处理未分配工单,前 2.5 周审查 109 个工单,路由准确率约 96%,每周节省 8–14 工时,月运营成本低于 $30。低于置信度的工单仍由人工复核,团队通过 CloudWatch 监控并每周优化提示词与路由逻辑。
Microsoft Agent Framework 发布 AG-UI 交互接入、FoundryMemoryProvider 记忆、CodeAct 执行与弹性后台执行四项更新,覆盖 .NET 与 Python,并提供 FastAPI 与 ASP.NET Core 示例。
推荐理由:原文给出了四项能力更新与跨语言示例,读者可据此判断哪些能力能直接接入现有应用。
Liquid AI 为 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过推测解码在不改变输出质量的前提下加速推理。草稿模型增加 280M 参数(+8.9%),在 M5 Max 上解码加速 2.30x-3.13x、端到端加速 1.56x-2.62x;在 H100 上解码加速 20.4x-2.66x、端到端加速 1.64x-2.27x。
推荐理由:原文给出了具体加速数据和多框架支持,读者可据此评估在边缘设备或 GPU 上部署该草稿模型的性价比。
Meta 周三发布一款不带摄像头的 Ray-Ban 眼镜,仅支持语音交互,并称 Muse 助手即将登陆其眼镜产品。同场推出的新款 VR 眼镜明年春季上市,售价 $1,300,比 Quest 3 轻五倍。Meta 已修复可让黑客控制他人 Muse 智能体的漏洞,Amazon 也已屏蔽 Meta 智能体访问其购物平台。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构通过 AlphaFold Database 开放超过 2800 种病毒的蛋白质复合物预测结构,约 30% 为科学界全新发现的相互作用。
推荐理由:开放预测结果与推理流水线为研究者提供了可复用的基础设施,降低未来疫情中蛋白质结构解析的门槛。
Qualcomm 推出 Snapdragon Sound Elite Gen 2,面向 AI 驱动的无线耳机,提供实时翻译和情境辅助功能。配备摄像头的机型可结合视觉与音频输入理解周围环境。
Google 于下周四将发射一颗实验卫星,具备足够的算力以在太空回答简单 AI 查询。该卫星为实验性项目,具体模型版本、参数规模及算力指标原文未披露。
summary_zh: Apple Watch Series 12 和 Ultra 4 用户报告设备随机重启,原因是 Neural Engine 超时触发 panic-full 日志。
Ben's Bites 报道 Claude Opus 5.5 发布,称其基准表现优于 Fable 5.1、价格低于 Opus 5,默认思考等级为 medium,Claude Code 五小时限制增加 20% 并引入银行式速率限制重置。
summary_zh: 全新旅行者 7 于 9 月 23 日开启预售,燃油版 1.5TD 探索+ 入门 14.99 万元,C-DM 插混版 PRO 15.99 万元起,共 7 款车型。
奕境 X9 于 9 月 24 日上市,共四款增程车型,售价 28.98 万至 36.98 万元。车辆搭载华为鸿蒙座舱 HarmonySpace 6 与乾崑智驾 ADS 5,全系配备华为 XPIXEL 百万像素智慧投影大灯,首发 AMS 舱内多模态感知系统。奕境由东风与华为乾崑全栈原生共创,锚定 30 万元级家庭旗舰市场。
Meta 在 Connect 发布 Muse 个人智能体及其硬件组合,包括支持语音与实时视频的 Muse、搭载唤醒词的 Meta 眼镜、Muse Mail、Mac 电脑使用、1500+ 连接器以及与 Walmart、Best Buy 等零售合作。
推荐理由:Meta 将 Muse 定位为个人智能体的核心,硬件与 Agent 深度绑定,读者可据此观察个人 Agent 的分发路径与商业模型如何演化。
summary_zh: Meta 展示了 Muse Charm,一款小型 AI 设备,用户无需解锁手机或打开应用即可与 Muse 助手对话。设备主打便携与即时语音交互,将 Muse 助理带入口袋钥匙扣形态。
summary_zh: MIT Senseable City Lab学者出版新书《How AI Sees the City: Urban Visual Intelligence》,探讨视觉AI在城市研究中的应用与隐患。
summary_zh: Meta 推出由 K-Pop 明星 LISA 联名设计的 Meta Glasses by LISA 智能眼镜系列。每副眼镜附带一款以 LISA 宠物为灵感的独家收藏挂饰。 Meta 推出由 K-Pop 明星 LISA 联名设计的 Meta Glasses by LISA 智能眼镜系列。每副眼镜附带一款以 LISA 宠物为灵感的独家收藏挂饰。
summary_zh: Meta 在年度开发者大会上发布 3 款内置 A.I. 的智能眼镜,再次强调 A.I. 对用户的赋能作用。 Meta 在年度开发者大会上发布 3 款内置 A.I. 的智能眼镜,再次强调 A.I. 对用户的赋能作用。
Anthropic 与霍华德·休斯医学研究所 Janelia 校区合作推出 Model Hardware Standard(MHS),通过软件框架连接不同厂商的实验室设备,并让 AI 智能体直接控制仪器、协调实验。MHS 可集成到任何具备可编程接口的设备,消除定制化代码需求;研究团队将原本需要数月的实验搭建缩短至数小时。
推荐理由:平台大幅缩短设备互联与实验搭建时间,为实验室自动化提供了可迁移的集成方法。
summary_zh: NVIDIA 发布 NV-Reason-CT Open 3D CT VLM,专为放射科医生链式推理(Chain-of-Thought Reasoning)设计。
PyTorch Foundation OSPO 与学术推广工作组在 PyTorchCon NA 2026 Day 0 举办学术工作坊,邀请使用 PyTorch、DeepSpeed、Helion、Ray、Safetensors、vLLM 的学术开源项目提交。
summary_zh: GPU 集群即使通过所有健康检查,仍可能无法运行 AI 工作负载。512-GPU 训练任务可能因单卡慢、链路负载下降或配置路由问题而性能不达标或失败。
YouTube 宣布推出 Custom Feeds,用户输入描述即可生成自定义信息流标签页,可保存多个,将率先在美国上线网页、移动端和电视端。今年晚些时候评论区将支持发布 GIF,可搜索热门动图并用于普通视频和 YouTube Shorts;私信功能新增群聊,初期仅限美国、英国、新加坡、巴西和部分欧洲国家。
HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。
推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。
GitHub Copilot 应用重写了 Pull Request 视图,以支持单文件变更量极大的 Pull Request。方案将代码几何与评论块几何分离,用惰性测量、滚动锚定和单通道调度避免跳动,并配合流式数据管道与缓存策略;实测在 2,200 文件、超百万行变更、400+ 行内评论的极端案例上仍保持流畅。
summary_zh: NodeWright 用于管理 Kubernetes 节点本身的内核设置、系统包、存储布局、安全代理及 GPU 工作负载依赖的主机级调优。
该方案基于 Strands Agents SDK 构建单一 AI Agent,运行时动态调用 Amazon Bedrock(Claude Sonnet)、Amazon Rekognition 和 Amazon Transcribe,处理自然语言视频查询。
AWS 博客教程演示将 OpenCode 与 Amazon Bedrock 上的开源权重模型(Kimi K3、GPT-OSS 120B、Nemotron 3 Super 120B)配对,实现终端本地交互、推理在 AWS 账户内完成、无基础设施管理和按量付费。
Google Beam 正式扩展至美国、加拿大、英国、法国、德国、日本六国,由 18 家渠道伙伴部署支持,硬件由 HP Dimension with Google Beam 交付。
Google 宣布 Gemini 新增 Adobe、Airtable、Wispr AI、Picsart、Squarespace 和 SeatGeek 等连接应用,用户无需切换应用即可直接使用这些服务。
Google 发布 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts 两款文本转语音模型,并提供支持 2000+ 声音与自定义声音的互动 Playground。
Microsoft Research 在 Physical AI Toolchain 中新增行业首个机器人推理卸载能力,可将 SO-101、UR10e 等机器人的推理从机载 GPU 卸载至边缘或云 GPU。实验显示,卸载改善了移动操作任务的成功率、响应精度和电池续航,并支持通过 Kubernetes 自动容器化与编排。
推荐理由:首次系统量化了机器人推理卸载的收益,为物理 AI 基础设施选型提供可对比的实测依据。
Google DeepMind 为 Private AI Compute 平台新增安全端侧持久记忆层,通过硬件隔离飞地与设备持有密钥实现跨设备连续协助。新架构在加密通道连接的隔离环境中临时解密处理请求,数据用完后立即重新加密;配套发布技术白皮书、系统架构与安全证明,并公开第三方审计结果供社区验证。
summary_zh: OpenAI Academy 成立两周年,OpenAI 宣布将 AI 技能带给更多社区。 OpenAI Academy 成立两周年,OpenAI 宣布将 AI 技能带给更多社区。
Google DeepMind 发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 模型,支持通过自然语言提示生成自定义角色语音。
Radical Numerics 创始人 Eric Nguyen 认为,生物安全正沦为 AI 军备竞赛,防御方正在落后。前斯坦福研究员团队曾基于 Evo/Evo 2 生成完整噬菌体基因组并合成功能性病毒。长上下文模型使 GLM 能处理 DNA、RNA 和蛋白质序列,团队通过 aptamer 实验展示了模型在 DNA 语言上的链式推理与自我优化能力。
GPT-6 Astra 能生成更结构化、上下文感知更强的法律文档,让律师更专注于策略制定。