AlphaFold数据库新增数千种病毒蛋白复合物结构预测
AlphaFold数据库于9月24日新增超过8,000个病毒蛋白二聚体结构预测,涵盖23个含有人类感染成员的病毒家族,并作为“大流行防范门户”的一部分上线。
推荐理由:AlphaFold数据库新增病毒蛋白复合物预测,为传染病研究和疫苗设计提供了新的结构参考。
AlphaFold数据库于9月24日新增超过8,000个病毒蛋白二聚体结构预测,涵盖23个含有人类感染成员的病毒家族,并作为“大流行防范门户”的一部分上线。
推荐理由:AlphaFold数据库新增病毒蛋白复合物预测,为传染病研究和疫苗设计提供了新的结构参考。
小米发布 MiMo-V2.6-Pro 与 Flash,均为原生全模态开源模型,Pro 在 Artificial Analysis Intelligence Index 得分 46,总参数 1.02T / 激活 42B,输入 $0.435/M、输出 $0.87/M。
推荐理由:小米推出原生全模态开源模型并附带 RL 环境与训练代码,为后训练缩放提供了一条更低成本的可复用路径。
GPT-6 Astra 是 OpenAI 面向商业场景的最强模型,具备高级推理、计算机使用能力,以及更强的写作与设计判断力。
NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。
推荐理由:单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。
Google DeepMind 发布 Gemini Omni 1.1 Flash,面向开发者提供场景续写、首尾帧插值、视频参考和 4K 放大等生成视频控制能力。
推荐理由:相比前代只参考最后 1 秒画面,新版本可读取 10 秒上下文并把视频续写到 40 秒,开发者可据此判断生成视频的可控程度。
AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。
推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Google DeepMind 发布 WeatherNext 模型,在气旋路径、强度和风场预测上平均比前代多出一天预报精度,相当于十年气象进展。该模型已在 Nature 发表论文,并在 2025 年飓风季帮助 NHC 对 Hurricane Melissa 做出历史性预报。
推荐理由:该模型在气旋路径、强度和风场预测上平均多出一天预报精度,相当于十年气象学进展,并已开源模型与代码供研究社区使用。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为推理时传入纯语言策略的问答任务,无需重新训练即可适配新策略,在文本安全上匹配最高 7 倍规模的开源 guard 模型,并在多模态审核上刷新 SOTA。模型可在单张 16GB NVIDIA GPU 上运行。
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
DharmaOCR 通过领域专精与两阶段训练(监督微调 + DPO),在巴西葡萄牙语基准上得分 0.925,显著高于 Mistral OCR4 的 0.798 与 Unlimited-OCR 的 0.7587。监督微调将参数集中于巴西葡萄牙语的词汇、句法与文档结构,DPO 阶段则降低推理时的退化率与不稳定输出。两阶段缺一不可:微调建立领域能力,DPO 确保该能力在生产条件下稳定。
Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。
推荐理由:原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。
Inkling 由 Thinking Machines 发布,是一个原生接收图像、文本和音频输入的大规模多模态开源模型,总参数约 1T、活跃参数 41B,支持 1M 上下文窗口。
推荐理由:Inkling 是原生接收图音文三模态的大规模开源模型,提供 BF16 与 NVFP4 双版本及 day-0 支持的推理引擎,读者可据此评估其在多模态推理基准中的相对位置。
summary_zh: BAIR 2026 届博士毕业生涵盖机器人与具身智能、大语言模型与推理、计算机视觉、生成式建模、AI 安全、人机交互、AI for Science 等方向。
Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。
推荐理由:Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。
Zyphra 发布 ZAYA1-74B-preview 与 8B-A0.6B MoE,在 AMD GPU 上训练。CohereLabs 发布 command-a-plus-05-2026-bf16,旗舰 Command A+ 改为 Apache 2.0 许可。Poolside 将 Laguna-M.1 置于 Apache 2.0 下,并承诺开放权重为默认。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。
推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的 12B 多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干,16GB 显存或统一内存即可本地运行。
推荐理由:无编码器架构把视觉与音频直接接入 LLM 主干,读者可了解端侧多模态模型在显存与延迟上的取舍。
Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。
推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。
Gemma 4 E2B/E4B 采用跨层 KV 共享以缩减长上下文缓存;Laguna XS.2 引入逐层注意力预算分配;ZAYA1-8B 使用压缩卷积注意力;DeepSeek V4 结合 mHC 与压缩注意力。原文聚焦 Transformer 块、残差流、KV 缓存与注意力计算部分,未涉及数据集、训练计划或 benchmark 对比。
西北大学工程师用可打印的 MoS2 和石墨烯电子墨水在柔性聚合物上制造人工神经元,通过部分分解聚合物形成窄导电路径,产生类似神经元放电的电信号。实验显示这些信号在小鼠小脑切片上匹配生物神经元的时间与形状特征,可靠激活真实神经回路。研究发表于 Nature Nanotechnology,作者指出该技术有望推动脑机接口、神经假体及能效更高的类脑计算硬件。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。
推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。
Google Research 推出 S2Vec,一个自监督框架,通过将城市地理空间数据栅格化为多层图像并使用掩码自编码学习通用嵌入向量。在社会经济预测任务的零样本地理外推上,S2Vec 表现优于 SATCLIP、GEOCLIP、RS-MaMMUT、Hex2vec 和 GeoVeX 等基线模型。但在树冠覆盖率和海拔等环境任务上仍有明显改进空间。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
summary_zh: Arcee AI 发布 Trinity Large(400B MoE,13B 激活参数),采用 SWA、QK-Norm、NoPE 与门控注意力。
Mistral AI 发布 Mistral OCR 3,模型可通过 API(mistral-ocr-2512)或 Mistral AI Studio 中的 Document AI Playground 使用,定价为每 1,000 页 $2,Batch API 折扣后为每 1,000 页 $1。
Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。
推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。
推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。
Mistral Small 3.1 正式发布,在文本指令、多模态理解和长上下文任务上超越 Gemma 3 与 GPT-4o Mini,推理速度达 150 tokens/秒。