从 Atari 到 EVE Online:Google DeepMind 十五年游戏 AI 研究历程
summary_zh: Google DeepMind 回顾十五年来从 Atari 到 EVE Online 的游戏 AI 研究,与 Fenris Creations 等游戏工作室合作开发 SIMA 多世界智能体。
summary_zh: Google DeepMind 回顾十五年来从 Atari 到 EVE Online 的游戏 AI 研究,与 Fenris Creations 等游戏工作室合作开发 SIMA 多世界智能体。
维尔茨堡大学团队开发出小于1微米的光驱动纳米机器人,可追踪、捕获并释放细菌。机器人通过纳米天线线对齐光的偏振方向实现转向,利用光子反冲力推进,能在实验室条件下有效"清洁"微观环境。携带细菌集群时仍可灵活机动,但速度会有所下降。
Google Research发布PhotoScan,一种基于深度学习的研究框架,可从标准2D智能手机照片估算三维身体成分指标(体脂率、A/G比、V/S比),用于预测胰岛素抵抗。
宾州大学研究团队将合成DNA与钙钛矿半导体结合,制成可在低于0.1伏下工作的memristor,功耗约为传统闪存十分之一,存储密度更高。器件在约250华氏度仍稳定运行超六周,研究已发表在Advanced Functional Materials并申请专利。
summary_zh: 作者结合 Substack 新推出的 AI 检测器功能与本地 DIY LLM 项目,演示如何从零实现一个 AI 文本检测器,并将其用作验证器训练小语言模型生成可规避检测的文本。
微软研究院的新基准 MindTopo 发现,专有与开放权重多模态模型在静态拓扑推理上明显强于交互规划,且都远低于人类。它按连续性、分离、顺序、包围和绳结五类,测试静态场景问答,以及模拟环境中须维持或改变关系的动作规划。规划失败常在理解场景之后出现,模型失去对结构关系的追踪,或提出违反环境约束的动作。
Google DeepMind 发布多语言手语转文字模型 SL2T,首次将手语 AI 带入 Gboard 和 Live Transcribe,从 ASL 到英语在 Pixel 11 上可用且无需额外付费。
推荐理由:原文给出 ASL 到英语的零样本 BLEURT 分数与隐私保护方案,读者可据此判断该功能在真实设备上的可用性与隐私边界。
AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。
推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。
CARE-X是微软研究介绍的胸部X光统一视觉语言模型,结合生成式报告与结构化预测并通过DAPO奖励对齐学习优化临床正确性。该模型在ReXVQA基准达到94%准确率,并在印度Narayana Health临床数据上验证了罕见ICU病理检测效果。工具增强测量实验显示,Qwen3-VL-4B-Instruct结合确定性计算工具后,测量依赖条件的F1平均提升43.6个百分点。
推荐理由:CARE-X通过联合训练生成与判别能力,在统一模型中实现灵活报告生成与校准预测,为放射学人工智能提供了可迁移的多任务优化方法。
MIT CSAIL与清华大学提出GeoPT预训练方法,通过130万组合成动力学样本让仿真模型获得物理直觉,在工业基准上达到峰值性能的速度提升两倍、所需标注数据减少60%。该方法在复杂3D形状、战斗机气动、船体波浪和汽车碰撞等场景中均优于现有模型,并成功泛化到未训练过的光传播模拟。
推荐理由:GeoPT用合成动力学预训练让仿真模型更快更省数据,为构建物理基础模型提供了可迁移的新范式。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Google DeepMind 发布 WeatherNext 模型,在气旋路径、强度和风场预测上平均比前代多出一天预报精度,相当于十年气象进展。该模型已在 Nature 发表论文,并在 2025 年飓风季帮助 NHC 对 Hurricane Melissa 做出历史性预报。
推荐理由:该模型在气旋路径、强度和风场预测上平均多出一天预报精度,相当于十年气象学进展,并已开源模型与代码供研究社区使用。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为推理时传入纯语言策略的问答任务,无需重新训练即可适配新策略,在文本安全上匹配最高 7 倍规模的开源 guard 模型,并在多模态审核上刷新 SOTA。模型可在单张 16GB NVIDIA GPU 上运行。
MIT 与斯坦福等机构的研究发现,AI 辅助虽提升非专家和临床医生诊断皮肤病的准确率,但可解释性方法的影响因用户知识水平而异。非专家倾向于遵从 AI,尤其信赖 LLM 生成的解释,即使解释有误;临床医生则能抵抗错误解释,仅凭模型预测表现最佳。研究建议在设计医疗 AI 时应考虑用户差异,避免过度依赖模型。
推荐理由:同一解释对非专家与临床医生效果相反,提示医疗 AI 应按用户知识水平差异化设计解释方式。
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
MoE 模型通过路由器为每个 token 动态选择少量专家子网络激活,在增加总参数的同时保持每 token 计算稀疏。文章首先解释路由决策、负载均衡与训练中 specialization 的形成机制,随后报告了在 4 张 A100 GPU 上微调 350 亿参数多模态 MoE 的经验,涵盖 5 种失败的 sharding 方案、最终成功的方法,以及按层路由审计揭示的音频、视频与文本容量分配。
summary_zh: MIT 研究人员开发出一种基于硅光子学的 lidar 芯片,通过集成天线阵列大幅降低串扰,实现更宽视野和更低噪声。该设计采用三种不同几何形状的天线,使其在紧密排列时仍能保持一致的发光特性。
DharmaOCR 通过领域专精与两阶段训练(监督微调 + DPO),在巴西葡萄牙语基准上得分 0.925,显著高于 Mistral OCR4 的 0.798 与 Unlimited-OCR 的 0.7587。监督微调将参数集中于巴西葡萄牙语的词汇、句法与文档结构,DPO 阶段则降低推理时的退化率与不稳定输出。两阶段缺一不可:微调建立领域能力,DPO 确保该能力在生产条件下稳定。
Google DeepMind 与 Isomorphic Labs 发布 bioresilience 联合方案,通过预防、检测、响应三方面应对生物安全威胁。AlphaFold 映射近所有已知蛋白质三维结构,AlphaGenome 揭示基因组功能,IsoDDE 提供药物设计真实精度。AlphaEvolve 优化宏基因组测序算法以更快检测新疫情,SynthID 水印技术正适配生物序列筛查。
Meta 提出分层兴趣表征(Hierarchical Interest Representation),作为广告系统的上游表征层,基于数十亿交互数据端到端训练。
Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。
推荐理由:原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。
Inkling 由 Thinking Machines 发布,是一个原生接收图像、文本和音频输入的大规模多模态开源模型,总参数约 1T、活跃参数 41B,支持 1M 上下文窗口。
推荐理由:Inkling 是原生接收图音文三模态的大规模开源模型,提供 BF16 与 NVFP4 双版本及 day-0 支持的推理引擎,读者可据此评估其在多模态推理基准中的相对位置。
SensorFM 是一个大传感器基础模型,基于超过一万亿分钟、来自五百万参与者的无标注多模态可穿戴数据预训练,在心血管、代谢、睡眠和心理健康等35项判别任务上泛化,且通过 Agent classroom 可自动构建预测头。
summary_zh: PRX 团队公开了其预训练数据策略:从公开与内部数据集混合采集图像数据,用 VLM 重新标注,并以长caption 保证描述完整。流程上使用 Lance 做特征工程与数据集构建、MDS 格式流式读取;文本编码器切换至 Qwen3-VL 后改为训练时实时计算 latent,仅带来约 3–4% 吞吐量开销;图像统一以质量 92 的 JPEG 编码。
summary_zh: BAIR 2026 届博士毕业生涵盖机器人与具身智能、大语言模型与推理、计算机视觉、生成式建模、AI 安全、人机交互、AI for Science 等方向。
Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。
推荐理由:Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。
巴塞罗那大学 ICCUB 团队在 Nature Astronomy 发表 CIGaRS 框架,通过模拟基推断(simulation-based inference)从 Ia 型超新星成像数据中提取宇宙学和天体物理信息,精度可比光谱红移测量,且能同时分析数万颗超新星。
Zyphra 发布 ZAYA1-74B-preview 与 8B-A0.6B MoE,在 AMD GPU 上训练。CohereLabs 发布 command-a-plus-05-2026-bf16,旗舰 Command A+ 改为 Apache 2.0 许可。Poolside 将 Laguna-M.1 置于 Apache 2.0 下,并承诺开放权重为默认。
Together AI发布ParallelKernelBench(PKB)开源基准,包含87个来自真实代码库的多GPU内核生成问题,要求模型用CUDA内核替代PyTorch+NCCL并通过NVLink直接通信。
推荐理由:基准揭示前沿模型在多GPU内核生成上正确率与速度优势均有限,为分布式优化研究提供了可复现的测试平台。
Google Earth AI 发布 Farmscapes 向量化数据集,将英国 130,000 km² 高分辨率卫星影像中的树篱、石墙和林地转为可操作矢量清单。基于 RSF ViT 骨干(预训练于 3 亿+全球卫星图)微调,结合亚米影像与 1 米 LiDAR 双层标注,用 Polsby–Popper 紧凑度得分区分林地(≥30 米直径)、树丛与线性植被。
Google Research 发布 JAMA Dermatology 论文,2,345 名参与者测试 AI 皮肤状况辅助工具。AI 组命名准确率 23%,较对照组 8% 提升近三倍;Wizard of Oz 组达 36%。但下一步医疗决策准确率提升有限,AI 组略更倾向建议非紧急处理。
香港大学研究团队在 SiC MOSFET 中实现负微分电阻效应,首次在 10mK 下用单晶体管复现生物神经元的高效脉冲活动。该芯片可集成于量子处理器附近,大幅降低低温系统热负荷,并有望用于深空探测。相关论文发表于 Nature Communications。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。
推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的 12B 多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干,16GB 显存或统一内存即可本地运行。
推荐理由:无编码器架构把视觉与音频直接接入 LLM 主干,读者可了解端侧多模态模型在显存与延迟上的取舍。
summary_zh: Sebastian Raschka 整理了 2026 年 1 月至 5 月他标记的 LLM 研究论文清单,涵盖架构与模型设计、高效训练与推理、稀疏注意力与长上下文、推理与测试时计算、强化学习、智能体系统、编码智能体、扩散语言模型及评测基准等类别。
Google Research在Nature发表PHRM研究,通过智能手机前置摄像头在日常使用中被动监测心率,跨肤色MAPE<10%,RHR估计MAE<5bpm达到可穿戴设备精度。研究基于35万+视频片段和近700名多样本参与者,覆盖浅色到深色皮肤群体,并公开了最大规模智能手机视频数据集及预训练PHRM-mini模型供合格研究者申请。
推荐理由:PHRM在大规模日常使用中实现跨肤色符合行业标准的心率监测,MAE低于5bpm的RHR估计达到可穿戴设备水平,为智能手机被动健康追踪设立了新基准。
MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。
推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。
Mistral 收购 Emmi AI,宣布加码 Physics AI,覆盖航空航天、汽车、半导体与能源领域。已发布多项突破,包括 3D 机翼跨声速 CFD 数据集、GyroSwin 5D 代理模型、AB-UPT 支持 140M 体素单 GPU 推理,以及 NeuralDEM 端到端多物理场代理模型,部分成果已开源。
宾大物理学家 Bo Zhen 团队开发出激子极化激元(exciton-polariton),实现全光开关,仅耗约 4 皮焦耳能量。传统光子芯片在非线性激活步骤需光-电转换,而该技术可避免这一瓶颈,有望降低大 AI 系统的能耗并支持未来芯片上的量子计算功能。