AMD 以 82 亿美元收购 World Labs,Atlas 解决稀疏重建问题
AMD 收购 World Labs,价格 82 亿美元。World Labs 自 2024 年成立以来构建了面向创意、设计和机器人模拟的 AI 空间智能能力,并发布 Atlas 模型,通过结合生成模型与多视角几何解决稀疏重建问题,实现新相机视角预测。应用领域包括机器人强化学习环境、场景生成以及房地产、设计和施工的真实世界重建。
AMD 收购 World Labs,价格 82 亿美元。World Labs 自 2024 年成立以来构建了面向创意、设计和机器人模拟的 AI 空间智能能力,并发布 Atlas 模型,通过结合生成模型与多视角几何解决稀疏重建问题,实现新相机视角预测。应用领域包括机器人强化学习环境、场景生成以及房地产、设计和施工的真实世界重建。
Claude Opus 5.5 本周发布,在 SimpleBench 得 88.4%,被评 Anthropic 迄今最佳视觉模型,成本约比 Fable 5.1 低 60%。
AMD全股票收购李飞飞创办的空间智能公司World Labs,交割后李飞飞将出任AMD执行副总裁兼首席科学家,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。
推荐理由:AMD以82亿美元全股票收购空间智能公司World Labs,读者可借此观察芯片巨头在机器人仿真与物理AI新工作负载上的布局节奏。
研究者开发了一个不依赖系统发育的机器学习框架,仅从基因组序列预测菌株水平的噬菌体-宿主相互作用,在115,037个相互作用、949种细菌菌株和518种噬菌体的数据集上验证,可匹配现有物种特异性模型并指导噬菌体鸡尾酒设计。
summary_zh: 独立电影人 Jeff Synthesized 凭借《The Gifted》获得 Future Vision XPRIZE 大奖,从全球 2500 多部参赛作品中脱颖而出。
在 Amazon SageMaker AI 上用 AWS vLLM-Omni DLC 部署 Qwen3-TTS,文本与音频经同一条持久双向连接传输,语音可在整段生成完成前开始播放。
同一 AWS vLLM-Omni DLC 在 SageMaker AI 部署两个端点:FLUX.2-klein-4B 实时生成图像,Wan2.1-VACE-1.3B 再异步把该图像做成短视频。
summary_zh: Amazon Nova Act 基于多模态大语言模型处理 UI 截图而非 DOM 选择器,在早期企业客户用例中浏览器工作流准确率超过 90%,能适应样式变化而无需更新脚本。
NTU Singapore 团队开发 PLATO 数据库与 PhaseHub 分析平台,基于大语言模型挖掘 PubMed 文献并结合 MolPhase 算法,覆盖 5,118 条蛋白序列,其中 3,600 余条发生相分离、1,300 条未发生。研究发现真核生物相分离蛋白比例更高,且该比例随基因组增大趋于饱和。两平台已发表于 Molecular Plant。
summary_zh: 荣耀Magic9 Pro Max 首发评测。文章正文仅展示版权声明与公众号关注引导,未提供该机型任何具体参数、功能或评测细节。 荣耀Magic9 Pro Max 首发评测。文章正文仅展示版权声明与公众号关注引导,未提供该机型任何具体参数、功能或评测细节。
summary_zh: Simon Willison 用 Claude Opus 5.5 根据三张 kākāpō 照片生成 HTML5 Canvas 像素动画页面,20 只以上几维鸟随音乐跳跃跳舞,点击触发彩纸、气球等特效。
Meta 发布 Muse 挂件设备,配备 2 英寸屏幕显示可爱 avatar,可进行实时对话、回复邮件、预订旅行和购物,计划 12 月发售。Meta 同时推出无摄像头智能眼镜,将摄像头移至挂件以改变录制时的责任主体。研究者指出 cute 设计具有"charming and disarming"效果,可能降低用户防备,但不同世代和文化接受度存在差异。
研究提出 Pred-MutPRI 框架,结合加权原子级相互作用网络、掩码 ESM-2 熵项与 AlphaFold3 局部有效应变描述符,用 XGBoost 回归预测蛋白-RNA 突变 ΔΔG。在序列不重叠、结构低重叠的盲测集上 PCC 达 0.705,优于现有预测器;数据集与 Python 包已公开。
summary_zh: SpaCEy 是一种基于图神经网络的可解释方法,用于在组织切片中发现与临床结局相关的空间重要区域。相比现有方法依赖预定义细胞类型标签或局部聚类,SpaCEy 能直接从连续分子测量中识别具有临床意义的连贯空间模式,并提供驱动结局的分子标记组合。
summary_zh: SkyRL 是开源 RL 框架,结合 Amazon SageMaker HyperPod 的 Ray 集群与 GRPO 后训练,将 Qwen3-VL-8B 在 VisGym SFT 检查点上的迷宫求解率从 43.75% 提升至 95% 以上。
Qwen3-TTS-12Hz-1.7B-Base 是阿里千问团队公开的文本转语音模型,支持 10 种语言、基于 12Hz 语音 tokenizer 与流式生成,可通过少量参考音频实现说话人声音克隆,并跨语言保持声音身份。
Ben 用了 Astra、Codex、Factory Droid 和多个 subagent 搭建了一个设备时间轴网站 bentossell.com/devices,展示 1976 到 2026 年共 87 款设备,所有图片由 Astra 生成。用户可拖动时间轴查看不同年份的设备,并投票"had/wanted",结果通过链接分享;投票数据由 here.now 存储,页面不存数据无需登录。
Google Photos 新增 Gemini Spark、数字衣橱、Moods、Remix 模板和升级标记工具五项功能,涵盖照片清理、整理与编辑分享。Gemini Spark 为新增 AI 功能,其余功能均面向照片管理与创意玩法。
summary_zh: 任正非重申华为不造车,将继续帮助东风造好车,双方讨论了奕境 X9、猛士 X700 和岚图梦想家 9 等车型。DeepSeek 年化收入运行率达约 10 亿美元,数月内翻倍,模型 API 价格上调约 2.3 至 4.5 倍。
Kai Cao 等人在 Nature Communications 发表一种结构信息驱动的深度学习框架,用于建模 TCR-peptide-HLA 相互作用。作者来自 Broad Institute of MIT and Harvard、Massachusetts General Hospital、MIT 等机构,研究获得 AstraZeneca、NIH、DOE 等资助。
Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。
推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为企业对话模型加上动态视觉形象,已在 Gemini Enterprise 上线。
推荐理由:原文给出实时视频形象与异步工具调用的能力说明,读者可据此了解企业智能体的交互形态变化。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构通过 AlphaFold Database 开放超过 2800 种病毒的蛋白质复合物预测结构,约 30% 为科学界全新发现的相互作用。
推荐理由:开放预测结果与推理流水线为研究者提供了可复用的基础设施,降低未来疫情中蛋白质结构解析的门槛。
summary_zh: 全新旅行者 7 于 9 月 23 日开启预售,燃油版 1.5TD 探索+ 入门 14.99 万元,C-DM 插混版 PRO 15.99 万元起,共 7 款车型。
奕境 X9 于 9 月 24 日上市,共四款增程车型,售价 28.98 万至 36.98 万元。车辆搭载华为鸿蒙座舱 HarmonySpace 6 与乾崑智驾 ADS 5,全系配备华为 XPIXEL 百万像素智慧投影大灯,首发 AMS 舱内多模态感知系统。奕境由东风与华为乾崑全栈原生共创,锚定 30 万元级家庭旗舰市场。
中国数字医疗通过 WeChat、Alipay 等应用覆盖 14 亿人口,远程医疗和 AI 医生头像已融入日常。中国在肿瘤药研发和全球药物授权交易中份额快速上升,今年可能占全球药物授权交易的 60%。西方药企如辉瑞正从 3SBio、Innovent Biologics 等中国公司授权数十亿美元抗癌候选药物。
summary_zh: MIT Senseable City Lab学者出版新书《How AI Sees the City: Urban Visual Intelligence》,探讨视觉AI在城市研究中的应用与隐患。
summary_zh: Meta 推出由 K-Pop 明星 LISA 联名设计的 Meta Glasses by LISA 智能眼镜系列。每副眼镜附带一款以 LISA 宠物为灵感的独家收藏挂饰。 Meta 推出由 K-Pop 明星 LISA 联名设计的 Meta Glasses by LISA 智能眼镜系列。每副眼镜附带一款以 LISA 宠物为灵感的独家收藏挂饰。
summary_zh: Meta 在年度开发者大会上发布 3 款内置 A.I. 的智能眼镜,再次强调 A.I. 对用户的赋能作用。 Meta 在年度开发者大会上发布 3 款内置 A.I. 的智能眼镜,再次强调 A.I. 对用户的赋能作用。
AlphaFold数据库于9月24日新增超过8,000个病毒蛋白二聚体结构预测,涵盖23个含有人类感染成员的病毒家族,并作为“大流行防范门户”的一部分上线。
推荐理由:AlphaFold数据库新增病毒蛋白复合物预测,为传染病研究和疫苗设计提供了新的结构参考。
Apple 研究提出通过潜在空间蒸馏压缩流式神经音频编码器,以预量化潜在表示作为监督目标,仅训练学生编码器回归教师逐帧潜在值。2.8× 压缩下,蒸馏学生在五个教师-学生对上相对 WER 保持在 1.9% 以内,且同等容量独立训练分词器提升 3.9%。该方案覆盖两种分词接口,无需微调。
UpTCR 是一个用于 T 细胞受体-抗原结合识别的大语言模型,采用统一渐进知识迁移架构。作者来自江南大学、清华大学深圳国际研究生院、澳门大学、腾讯 AI for Life Sciences Lab 等机构,文章发表于 Nature Communications,2025 年 11 月投稿,2026 年 9 月接收并发表。
综述探讨AI在放疗流程中的应用,涵盖器官分割、剂量预测、治疗计划优化与结局预测。涉及深度学习、U-Net、扩散模型及大语言模型在放疗物理与临床中的实践与挑战。
summary_zh: NVIDIA 发布 NV-Reason-CT Open 3D CT VLM,专为放射科医生链式推理(Chain-of-Thought Reasoning)设计。
该方案基于 Strands Agents SDK 构建单一 AI Agent,运行时动态调用 Amazon Bedrock(Claude Sonnet)、Amazon Rekognition 和 Amazon Transcribe,处理自然语言视频查询。
Google Beam 正式扩展至美国、加拿大、英国、法国、德国、日本六国,由 18 家渠道伙伴部署支持,硬件由 HP Dimension with Google Beam 交付。
Google 宣布 Gemini 新增 Adobe、Airtable、Wispr AI、Picsart、Squarespace 和 SeatGeek 等连接应用,用户无需切换应用即可直接使用这些服务。
阿里云发布 Qwen Image 2.1,参数仅7B,可在RTX 3090等消费卡运行。内部基准Qwen Image Benchmark得分60.2,接近GPT Image 2.5 Sunburst(67)和Nano Banana 2.0(59.82);AI Arena图像编辑得分1367,位列开源第一。
Ringg 使用 GPT-5.6 驱动多语言智能体,在语音、聊天、WhatsApp 和网页端处理客服通话,解决比例最高达 65%。相比 GPT-4.1,成本降低 90%。
summary_zh: 研究者提出 probe guidance 方法,利用冻结的扩散模型内部状态构建引导信号,无需推理时额外前向传播即可为流匹配模型提供可靠引导路径。