超越自然序列:MIT 推出 PottsMPNN 蛋白质设计框架
MIT 生物系推出 PottsMPNN 机器学习框架,融入物理原理以改进序列生成与突变稳定性预测。该模型通过引入噪声、氨基酸配对分布和进化相关序列训练,更好地理解序列-能量景观,能为无天然对应序列的全新设计结构生成可行序列。研究显示,减少对天然序列的依赖可提升结构兼容性与能量预测精度。
MIT 生物系推出 PottsMPNN 机器学习框架,融入物理原理以改进序列生成与突变稳定性预测。该模型通过引入噪声、氨基酸配对分布和进化相关序列训练,更好地理解序列-能量景观,能为无天然对应序列的全新设计结构生成可行序列。研究显示,减少对天然序列的依赖可提升结构兼容性与能量预测精度。
Google Earth AI推出实验性行星预测引擎(PPE),可根据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将原本数周的手动流程压缩至分钟级。
推荐理由:原文展示了自主地理空间建模工作流,读者可据此理解AI如何缩短从数据发现到模型训练的周期。
MIT研究人员开发CrysVCD框架,在材料生成初期通过价电子约束规则筛选不稳定结构,与扩散模型和语言模型结合使用。近70%计算生成达到晶格动力学稳定标准,机械稳定性和亚稳性分别达68%和85%,生成效率比事后筛选提高一个数量级。
MIT工程师提出名为η-learning的机器学习方法,可在不含极端事件的历史数据中学习并生成统计上合理的极端情景,如百年一遇暴雨的可能位置、范围和强度。该方法结合点统计与空间地图约束,已应用于美国大陆极端降水模拟,相关论文发表于Nature Communications。
推荐理由:该方法不依赖历史极端事件数据即可生成罕见情景,为城市和金融等领域的风险评估提供了可迁移的新工具。
Google Research 提出 Biomarker Discovery Framework,一个多智能体系统,用于从可穿戴传感器数据中优先排序候选生物标志物。在三个队列共9,279名参与者-观测中,框架自主识别了41个心理健康和25个代谢候选数字生物标志物。框架结合假设生成、统计分析、对抗验证和文献推理,通过11项内部检查电池分配报告标签,保持统计严谨性与人类监督。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,把匿名聚合的移动性模式与 Gemini 的文本嵌入对齐,为地点生成兼顾身份与动态功能的嵌入向量。在公开基准上,该方法在访问意图预测上最高取得 81.9% 的相对提升,价格水平分类提升 75.1%,忙碌度估计准确率提升 24.7%。
summary_zh: MIT 研究人员开发了预测电化学合成氨催化剂性能的新方法,通过密度泛函理论模拟替代试错筛选,可在数年内加速寻找使该方法与 Haber-Bosch 工艺具备成本竞争力的催化剂化合物。
OlmoEarth Studio 现支持计算并导出自定义 embedding 向量,输出为 COG,模型权重与源码公开。可选 Nano(128 维,1.4M 参数)、Tiny(192 维,6.2M 参数)或 Base(768 维,89M 参数)编码器,时间跨度 1-12 个月,分辨率 10-80 米。越南 Ca Mau 红树林区仅用 60 个标注像素训练逻辑回归,加权 F1 达 0.84。
Multiverse Computing 提出高效知识蒸馏方法,通过缓存教师模型 top-100 logits 与融合分块 KL 损失,避免构建全词汇表×序列矩阵,在单 H200 上把峰值显存从约 250GB 降至约 58GB,并在 32K 上下文下把蒸馏从四卡节点缩至单卡。代码已开源:github.com/CompactifAI/Full-Chunked-KL-Loss
推荐理由:通过缓存 top-K logits 与融合分块 KL 损失两条改动,把蒸馏显存占用压到单卡可跑,为长上下文蒸馏提供了可复现的低成本路径。
Google DeepMind 发布 WeatherNext 模型,在气旋路径、强度和风场预测上平均比前代多出一天预报精度,相当于十年气象进展。该模型已在 Nature 发表论文,并在 2025 年飓风季帮助 NHC 对 Hurricane Melissa 做出历史性预报。
推荐理由:该模型在气旋路径、强度和风场预测上平均多出一天预报精度,相当于十年气象学进展,并已开源模型与代码供研究社区使用。
summary_zh: MIT 团队在 Joule 发表钠金属电池新电解质研究,通过 AI 辅助筛选 10 万个候选分子,最终确定最小溶剂 DMFSA,在保持电极稳定的同时加快离子传输,提升快充快放性能。
Alexander Rakhlin 被任命为 MIT Statistics and Data Science Center(SDSC)主任,接替自 2021 年起担任主任的 Ankur Moitra,Philippe Rigollet 曾在 2024-25 年担任临时主任。
MIT 和 Beth Israel Hospital 于 1975 年开始收集和数字化心电图记录,1980 年制成磁带并通过邮寄分发,最终成为 PhysioNet 首个数据库。
美国能源部在 Genesis Summit 上宣布首批资助项目,MIT 主导 6 个、参与 9 个,涉及量子传感器、稀土提取、聚变数字孪生、AI 驱动材料设计等方向。Phase I 阶段团队需展示 AI 与科学工作流整合,并评估科学价值;后续可申请进一步资助。研究经费待签订协议协议。
Google Research发布SymptomAI研究,基于Gemini Flash 2.0通过13,917人随机实验表明临床医生在超50%情况下更偏好其鉴别诊断,且主动询问策略显著优于被动回答。
推荐理由:该研究通过一万三千余人的随机对照实验,为对话式AI症状评估提供了与临床医生横向比较的基准数据,并揭示了主动询问策略对诊断准确性的提升作用。
MIT与Red Hat、IBM合作提出GIFT(Geometric Inference Feedback Tuning)框架,通过推理时扩展利用视觉语言模型自身的近似正确答案生成训练数据,自动修正模型在图像转CAD代码任务中的错误。实验表明,GIFT仅用约20%的计算量即可生成更准确的CAD程序,且生成的3D模型几何形状与真实模型更吻合。
推荐理由:该方法利用模型自身错误生成训练数据,以更低计算成本提升图像转CAD代码的准确性。
Meta 提出分层兴趣表征(Hierarchical Interest Representation),作为广告系统的上游表征层,基于数十亿交互数据端到端训练。
summary_zh: Ikigai 基于表格与时间序列数据构建基础模型,可持续接入企业多源数据,通过预测真实结果进行自我学习。该模型将企业流程数字化,提供大规模实时规划与模拟不同选项的能力。
SensorFM 是一个大传感器基础模型,基于超过一万亿分钟、来自五百万参与者的无标注多模态可穿戴数据预训练,在心血管、代谢、睡眠和心理健康等35项判别任务上泛化,且通过 Agent classroom 可自动构建预测头。
Jesse Thaler 接任 MIT 核科学实验室(LNS)主任,接替 Bolek Wyslouch。Thaler 是理论粒子物理学家,将 LNS 带入 AI 驱动发现的新阶段,并计划把 IAIFI 的跨学科框架引入 LNS。LNS 同时将参与能源部 Genesis Mission 的 AI 科研项目。
summary_zh: PRX 团队公开了其预训练数据策略:从公开与内部数据集混合采集图像数据,用 VLM 重新标注,并以长caption 保证描述完整。流程上使用 Lance 做特征工程与数据集构建、MDS 格式流式读取;文本编码器切换至 Qwen3-VL 后改为训练时实时计算 latent,仅带来约 3–4% 吞吐量开销;图像统一以质量 92 的 JPEG 编码。
Google Research 推出 TabFM,将表格预测重构为上下文学习问题,单次前向传播即可生成零样本预测。该模型基于数亿个合成数据集训练,无需手动特征工程与超参调优,目前已开源并集成至 Google Cloud BigQuery。
Google Research 在 CIDR 发表论文,提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境中测试数月,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总成本降低约 5%,实际 I/O 成本影响仅 0.5%。
Amazon 投资 Cascade Energy Center 项目,部署 TRISO 燃料驱动的 Xe-100 小型模块化反应堆,为数据中心和云基础设施供电。
Google Research 提出 Regularized f-Divergence Kernel Tests 框架,用于更灵敏、准确地审计机器学习模型的机器遗忘效果,理论上控制假阳性率并使假阴性风险随样本量增加收敛至零。
Google Research 在 I/O 2026 集中发布 Gemini for Science、Google Health 应用、Coralboard、WeatherNext、Groundsource、Gemma V4 等研究驱动产品与开源工具,并开放 Science Skills、Paper Assistant Tool 等实验性能力。
Mistral 发布 physics AI,将工程仿真从数小时/周缩短到秒级单 GPU 前向传播。整合 Emmi AI 作为企业解决方案中新基础能力,合作伙伴包括 ASML、Airbus、Safran 和 Siemens Energy。覆盖产品设计、工装工艺设计和实时数字孪生三大场景,不是替代传统求解器,而是大幅提升设计迭代吞吐量。
summary_zh: Google DeepMind 推出 AI 研究助手 Co-Scientist,帮助 Calico Life Sciences 的专家整合衰老生物学领域的分散发现,生成可验证的新假设。
summary_zh: 爱丁堡大学生物工程师 Filippo Menolascina 使用 Co-Scientist 梳理文献,针对代谢功能障碍相关脂肪性肝炎(MASH)生成新假设。
Together AI 与 Adaption 合作,让 Adaptive Data 用户可直接在 Adaption 平台优化数据集后执行 Together Fine-Tuning。
Google DeepMind 提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步计算岛以隔离硬件故障。实验表明,该架构在 2-5 Gbps 广域网上训练 120 亿参数模型,性能与传统方法持平且速度快 20 倍以上,并能混合不同代 TPU 硬件。
Google Research 提出 Simula 框架,将合成数据生成重构为机制设计问题,通过推理驱动实现可控制的数据集构建。论文发表于 Transactions on Machine Learning Research,在网络安全、法律推理、数学等五个领域最多生成 512K 数据点,全系统一致优于简单基线,且高质量数据比单纯增加数量更有效。
Google Research 推出 S2Vec,一个自监督框架,通过将城市地理空间数据栅格化为多层图像并使用掩码自编码学习通用嵌入向量。在社会经济预测任务的零样本地理外推上,S2Vec 表现优于 SATCLIP、GEOCLIP、RS-MaMMUT、Hex2vec 和 GeoVeX 等基线模型。但在树冠覆盖率和海拔等环境任务上仍有明显改进空间。
Google Research 发布 Groundsource 方法,利用 Gemini 从全球新闻报道中提取洪水事件,构建了覆盖 150 多个国家、260 万条记录的开放数据集。方法结合 Google Read Aloud 和 Cloud Translation API 进行多语言文本提取与标准化,并通过 Gemini LLM 完成分类、时间推理和空间定位验证。
推荐理由:该方法将非结构化新闻转化为结构化灾害数据,为全球洪水预测提供了新的数据基线。