LOCO-AdaMP:带内置 LOCO 推理的自适应小补丁集成与增强预测
LOCO-AdaMP 提出一种自适应小补丁集成框架,在高维稀疏场景下通过 LOCO 重要性引导特征采样,在保留渐近有效特征重要性推断的同时提升预测性能。该方法无需数据切分或模型重训练,对基模型无关,适用于回归任务中的预测与推断。实验在合成与真实数据集上验证了其在预测、推断能力和稳定性上优于现有方法。
LOCO-AdaMP 提出一种自适应小补丁集成框架,在高维稀疏场景下通过 LOCO 重要性引导特征采样,在保留渐近有效特征重要性推断的同时提升预测性能。该方法无需数据切分或模型重训练,对基模型无关,适用于回归任务中的预测与推断。实验在合成与真实数据集上验证了其在预测、推断能力和稳定性上优于现有方法。
SAIVE 提出一种基于直方图嵌套的过滤准则,从大型数据表中选取对 AI 分析更有价值的字段,假设底层数据服从 Zipf-Mandelbrot 幂律分布,并将指数 α 约束在合理范围内,作为无需专家参与的低成本筛选方法。该方法旨在解决企业数据湖字段冗余、难以用 AI 高效分析的问题,将在 IEEE MIT URTC 2026 发表。
SensWear 是一个开源、模块化、AI-ready 的可穿戴平台,解耦了形态、传感、数据接口与学习。紧凑柔性 PCB 主板配合可编程 1.2 V–5.5 V 子板接口,支持 PPG、触摸、温度、触觉和 LED 模块的即插即用。
堆叠 LSTM 在 NASA C-MAPSS 涡扇基准上对比同步环形 gossip、FedAvg、本地训练与集中训练,gossip 在 FD001 达终端窗口 F1 89.6±1.3%,FedAvg 89.9±1.1%,本地 83.6±6.7%,集中 93.5±2.1%。
Perch 和 BirdNET 等生物声学基础模型虽能高精度识别物种,但置信度未经校准、难以解释为真实出现概率。研究利用 WABAD 全局标注声学数据集生成校准先验,并提出将声学预测与地理先验融合的新方法,在保持判别能力的同时改善校准性,为生物多样性监测提供更可靠的声学方案。
DASA 使用冻结参考模型的激活梯度反馈引导连续合成输入嵌入优化,直接用于下游微调而无需离散 token 投影。在 Llama 与 Qwen 家族 1B–32B 模型、6 个基准上,DASA 达到与自然文本数据相当或更优的性能,多数对比超越 GRADMM,并实现 3.6–4.9 倍加速、峰值 GPU 内存相当。
VADER 首次为近似过滤向量搜索(FVS)引入声明式召回,用户只需指定期望召回目标,系统自动执行查询而无需手动调参。VADER 采用感知过滤器的召回预测器,在不同选择性与相关性下泛化,并在预测召回达到目标时提前终止。实验显示相比最优基线,VADER 速度提升最高 53%、结果质量提升 28%,实现近最优提前终止。
该研究提出 Wasserstein Causal Forests(WCF),处理每个单元结果为概率分布的因果推断场景,定义了有限网格变换的平均与条件平均处理效应及参考距离对比。
NVIDIA发布开源表格预测基础模型Kumo Tabular,单次前向传播即可预测,无需训练或调优。在TabArena等四个基准上排名第一,28M至215M参数规模下准确-效率达前沿,比LimiX-2快17倍。模型基于Transformer仅在人工数据上预训练,以OpenMDW-1.1许可证商业可用。
推荐理由:表格预测长期依赖梯度提升树,Kumo Tabular以单次前向传播提供无需训练与调优的预测且在TabArena等基准排名第一。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。
推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。
研究者开发了一个不依赖系统发育的机器学习框架,仅从基因组序列预测菌株水平的噬菌体-宿主相互作用,在115,037个相互作用、949种细菌菌株和518种噬菌体的数据集上验证,可匹配现有物种特异性模型并指导噬菌体鸡尾酒设计。
MIT研究人员借助AI算法优化脂质纳米颗粒辅料,使RNA疫苗在室温下可稳定保存一年,或在约37°C下稳定保存两个月。新冠mRNA疫苗在小鼠中产生的免疫应答与Moderna疫苗相当,且该方法同样适用于Pfizer配方和微针贴片递送。
推荐理由:AI算法用极少实验预测最佳辅料比例,显著加速了耐热RNA疫苗配方筛选。
summary_zh: ConTP 重塑转运蛋白功能空间,在进化距离之外解析底物特异性。由 KAUST 与宁夏医科大学合作完成,发表于 Nature Communications Biology(2026)。
mHolmes 是一个基于 Transformer 的迁移学习框架,用于预测尸体微生物群动态。在 34 具尸体的 21 天每日纵向数据上训练,交叉解剖预测任务(如髋到面部)MAE < 2 天。SHAP 分析识别出 7 个细菌类别作为 PMI 相关特征,适用于不完整观测和断离遗体的法医学场景。
summary_zh: Apple Machine Learning Research 提出 LIPPAX 算法,在联邦随机变分不等式上建立改进收敛率,在有界 Hessian、有界算子、低方差设定下缓解客户端漂移并提升保证。
研究提出 Pred-MutPRI 框架,结合加权原子级相互作用网络、掩码 ESM-2 熵项与 AlphaFold3 局部有效应变描述符,用 XGBoost 回归预测蛋白-RNA 突变 ΔΔG。在序列不重叠、结构低重叠的盲测集上 PCC 达 0.705,优于现有预测器;数据集与 Python 包已公开。
MIT 10名本科生参加PKG中心2026 Code.Tulsa项目,在塔尔萨与Muscogee和Cherokee部落合作开发AI与数据科学项目。学生参与原住民孕妇健康风险评估系统PRAMS调研,同时由Allie Zong协助开发面向25名原住民高中生的TASC科学夏令营,涵盖AI工程、DNA技术与物理化学。
在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%。RLHF 与 GRPO 需同时平衡大规模 rollout 生成和紧耦合策略训练,两侧速率不匹配会让加速器空闲或引发训练不稳定。更稀疏的 MoE 使训练更受通信而非算力制约;作业超出单实例后,通信从节点内 NVLink 转到更低带宽的节点间链路。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,用交互式仪表盘和自然语言搜索栏为工业气体与焊接分销商提供自助式租赁分析。TrackAbout 客户共管理 2750 万项资产、每月超 72.5 万张账单,此前取数需提交 SSRS 报表请求并等待数天甚至数周。
summary_zh: ResolVI 是一个基于自动编码变分贝叶斯的概率框架,用于校正空间转录组数据中的分割与量化误差。它将观测计数建模为真实表达、邻近细胞扩散信号和背景噪声三部分,使用负二项分布和泊松分布分别建模,并通过高斯混合分布表示细胞状态的不确定性。
Apple 研究提出通过潜在空间蒸馏压缩流式神经音频编码器,以预量化潜在表示作为监督目标,仅训练学生编码器回归教师逐帧潜在值。2.8× 压缩下,蒸馏学生在五个教师-学生对上相对 WER 保持在 1.9% 以内,且同等容量独立训练分词器提升 3.9%。该方案覆盖两种分词接口,无需微调。
DR-GEM 是一种自监督元算法,通过重构误差重新引导模型关注初始遗漏的模式,并利用平衡共识学习提升鲁棒性、过滤低质量数据。在合成与真实单细胞、空间转录组和 Perturb-seq 数据集上,DR-GEM 在获取可靠嵌入、恢复稀有细胞类型、过滤噪声、缓解细胞与患者层面代表性不足以及发现未见的遗传和空间特征方面优于现有方法。
Apple Machine Learning Research 提出半监督联邦 ASR 方案,通过在线伪标签与服务器端标注数据更新稳定化缩小与全监督联邦学习的差距。在 11 组对比中 9 组超越最强先验方法,域内平均提升 20.8%、跨域 10.0%。教师模型与锚定更新两条轴线相互耦合,锚定更新对数据增强和批量大小高度敏感。
summary_zh: MIT Poitras Center 设立 50 个为期两年的博士与博士后奖学金,每年颁发 5 个,持续十年,首批 5 位研究员已确定。
NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,埃及 NVIDIA Deep Learning Institute 学员一年内增长逾十倍,Hassan Allam Utilities 与 A15 将投资约 4 亿美元建设新数据中心。非洲一年内已有四座 AI 工厂宣布或上线,另有 656 兆瓦新产能待落地。NVIDIA 在非洲已培训逾 8.5 万名开发者,原定三年 10 万名目标。
Google Research 推出 MilleMiglia,一个 C++ 实例生成器,用于构建中段物流网络的真实基准。中段物流覆盖区域或大陆尺度的配送中心间运输,占物流成本大头且影响时效,但学术研究长期缺乏公开高质量数据。MilleMiglia 在 GitHub 开源,通过隐私保护的方式捕捉中段运输的多车辆接力、时间窗口与分拣同步等约束,为后续优化研究提供基础。
Google AI & Economy 项目新增诺贝尔经济学奖得主 Philippe Aghion、多伦多大学教授 Ajay Agrawal 等顾问与访问学者。Anu Madgavkar 和 Daniel Rock 将共同领导该研究项目,聚焦全球 AI 扩散、小企业生态与生成式 AI 对劳动力市场的影响。团队将持续更新 ATLAS v1.0 数据并推动实证研究。
ConvexGating 从单细胞细胞术数据的聚类结果中推断最优门控策略,旨在将聚类得到的细胞群体转化为可用于分选的高纯度、低步骤门控方案。flow cytometry、mass cytometry(cyTOF)和 CITE-seq 等高维数据场景中,手动门控依赖操作者经验且存在跨操作者变异,而聚类方法虽能无偏分离细胞却难以直接转为分选策略。
summary_zh: 联合国系统推出 UN System Data Commons,基于 Google Data Commons 构建的开源平台,整合全球统计数据为 AI 就绪知识图谱。
summary_zh: 研究团队利用定量方法对死后海马体组织中的阿尔茨海默病病理特征与微胶质细胞激活进行映射分析。数据来自USC ADRC,使用NACC统一数据集,资助方包括NIH、NSF及Chan Zuckerberg Initiative等。
GPT-6 Astra 帮助 Hex 的数据代理将分析答案转化为可交互可视化报告,使员工愿意分享这些可视化内容。
Naoki Egami 是 MIT 政治科学家,研究方向为社会科学方法论与外部效度,关注 AI 工具在研究中的准确性及误差识别。他于 2025 年加入 MIT 政治学系,同时为 IDSS 统计学与数据科学中心教员。
summary_zh: Glyph 将企业数据目录的列描述生成与类型标注建模为协作 LLM 智能体图。描述器通过 active RAG 从企业 GitHub 检索管道源码;标注器并行运行描述标签器、业务正则标签器和基于微调对比编码器的元数据标签器,再用 RRF 融合输出。
Google 发布 ATLAS 交互式开放数据体验,并联合 Google DeepMind 与 MIT FutureTech 推出基于 ATLAS 的科学家 AI 使用研究。
Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,支持在私有云、公有云、本地及完全气隙环境部署推理并保持控制。企业还可在受控环境用专有数据训练自有模型并保留数据与智能所有权,面向主权 AI 需求。Mistral 提到 Cloudera 平台承载 30 exabytes 客户管理数据。
Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测。该平台包含数千个分子效应预测,覆盖多个细胞类型,已在罕见病研究中验证变异功能。AlphaGenome Atlas 通过网站、AlphaGenome API 和 Google Antigravity 提供。
推荐理由:Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测,并推出 AVI 分数用于变异影响评估。
Google Research 评估了将 UK Biobank 欧洲 GWAS 结果迁移至 Biobank Japan 约 20 万日本样本的 PRS 性能,覆盖 BMI、血压、血脂等 8 项临床性状。
Google DeepMind 发布 WeatherNext 3,改用实时卫星观测数据直接训练全球天气 AI 模型。模型以 5 公里分辨率、每小时更新生成预报,降水预报 CRPS 最高较 IMERG 提升 60%,并已集成至 Search、Gemini、Maps 及 Google Cloud 平台。
推荐理由:WeatherNext 3 摒弃传统数值天气预报训练数据,改为直接使用实时卫星观测数据,将全球分辨率提升至5公里并实现每小时更新,降水预报CRPS最高改善60%。
Walter Torous 被任命为 MIT Center for Real Estate 执行主任,自 2026 年 7 月 1 日生效,接替曾任主任 Siqi Zheng。他将继续主管 MSRED 项目,并负责 CRE 的教学、联盟活动、筹款和重大活动。Torous 希望 MSRED 课程扩展至建筑、土木与环境工程、媒体实验室和 Sloan 等领域,并已开设 AI 与房地产课程。
Google Research 发布 TimesFM-3 时间序列基础模型,参数量 330M,预训练语料超过 1 万亿个时间点,原生支持多变量预测。模型可在单次前向传播中联合预测多条相关序列并输出 9 个分位数,同时支持历史协变量与已知未来协变量,无需任务级微调。
推荐理由:相比前代只做单变量预测,TimesFM-3 原生支持多变量与协变量输入,可用于零售、金融等实际预测任务。