LOCO-AdaMP:带内置 LOCO 推理的自适应小补丁集成与增强预测
LOCO-AdaMP 提出一种自适应小补丁集成框架,在高维稀疏场景下通过 LOCO 重要性引导特征采样,在保留渐近有效特征重要性推断的同时提升预测性能。该方法无需数据切分或模型重训练,对基模型无关,适用于回归任务中的预测与推断。实验在合成与真实数据集上验证了其在预测、推断能力和稳定性上优于现有方法。
LOCO-AdaMP 提出一种自适应小补丁集成框架,在高维稀疏场景下通过 LOCO 重要性引导特征采样,在保留渐近有效特征重要性推断的同时提升预测性能。该方法无需数据切分或模型重训练,对基模型无关,适用于回归任务中的预测与推断。实验在合成与真实数据集上验证了其在预测、推断能力和稳定性上优于现有方法。
SAIVE 提出一种基于直方图嵌套的过滤准则,从大型数据表中选取对 AI 分析更有价值的字段,假设底层数据服从 Zipf-Mandelbrot 幂律分布,并将指数 α 约束在合理范围内,作为无需专家参与的低成本筛选方法。该方法旨在解决企业数据湖字段冗余、难以用 AI 高效分析的问题,将在 IEEE MIT URTC 2026 发表。
SensWear 是一个开源、模块化、AI-ready 的可穿戴平台,解耦了形态、传感、数据接口与学习。紧凑柔性 PCB 主板配合可编程 1.2 V–5.5 V 子板接口,支持 PPG、触摸、温度、触觉和 LED 模块的即插即用。
堆叠 LSTM 在 NASA C-MAPSS 涡扇基准上对比同步环形 gossip、FedAvg、本地训练与集中训练,gossip 在 FD001 达终端窗口 F1 89.6±1.3%,FedAvg 89.9±1.1%,本地 83.6±6.7%,集中 93.5±2.1%。
Perch 和 BirdNET 等生物声学基础模型虽能高精度识别物种,但置信度未经校准、难以解释为真实出现概率。研究利用 WABAD 全局标注声学数据集生成校准先验,并提出将声学预测与地理先验融合的新方法,在保持判别能力的同时改善校准性,为生物多样性监测提供更可靠的声学方案。
DASA 使用冻结参考模型的激活梯度反馈引导连续合成输入嵌入优化,直接用于下游微调而无需离散 token 投影。在 Llama 与 Qwen 家族 1B–32B 模型、6 个基准上,DASA 达到与自然文本数据相当或更优的性能,多数对比超越 GRADMM,并实现 3.6–4.9 倍加速、峰值 GPU 内存相当。
VADER 首次为近似过滤向量搜索(FVS)引入声明式召回,用户只需指定期望召回目标,系统自动执行查询而无需手动调参。VADER 采用感知过滤器的召回预测器,在不同选择性与相关性下泛化,并在预测召回达到目标时提前终止。实验显示相比最优基线,VADER 速度提升最高 53%、结果质量提升 28%,实现近最优提前终止。
该研究提出 Wasserstein Causal Forests(WCF),处理每个单元结果为概率分布的因果推断场景,定义了有限网格变换的平均与条件平均处理效应及参考距离对比。
研究者开发了一个不依赖系统发育的机器学习框架,仅从基因组序列预测菌株水平的噬菌体-宿主相互作用,在115,037个相互作用、949种细菌菌株和518种噬菌体的数据集上验证,可匹配现有物种特异性模型并指导噬菌体鸡尾酒设计。
summary_zh: ConTP 重塑转运蛋白功能空间,在进化距离之外解析底物特异性。由 KAUST 与宁夏医科大学合作完成,发表于 Nature Communications Biology(2026)。
mHolmes 是一个基于 Transformer 的迁移学习框架,用于预测尸体微生物群动态。在 34 具尸体的 21 天每日纵向数据上训练,交叉解剖预测任务(如髋到面部)MAE < 2 天。SHAP 分析识别出 7 个细菌类别作为 PMI 相关特征,适用于不完整观测和断离遗体的法医学场景。
summary_zh: Apple Machine Learning Research 提出 LIPPAX 算法,在联邦随机变分不等式上建立改进收敛率,在有界 Hessian、有界算子、低方差设定下缓解客户端漂移并提升保证。
研究提出 Pred-MutPRI 框架,结合加权原子级相互作用网络、掩码 ESM-2 熵项与 AlphaFold3 局部有效应变描述符,用 XGBoost 回归预测蛋白-RNA 突变 ΔΔG。在序列不重叠、结构低重叠的盲测集上 PCC 达 0.705,优于现有预测器;数据集与 Python 包已公开。
summary_zh: ResolVI 是一个基于自动编码变分贝叶斯的概率框架,用于校正空间转录组数据中的分割与量化误差。它将观测计数建模为真实表达、邻近细胞扩散信号和背景噪声三部分,使用负二项分布和泊松分布分别建模,并通过高斯混合分布表示细胞状态的不确定性。
Apple 研究提出通过潜在空间蒸馏压缩流式神经音频编码器,以预量化潜在表示作为监督目标,仅训练学生编码器回归教师逐帧潜在值。2.8× 压缩下,蒸馏学生在五个教师-学生对上相对 WER 保持在 1.9% 以内,且同等容量独立训练分词器提升 3.9%。该方案覆盖两种分词接口,无需微调。
DR-GEM 是一种自监督元算法,通过重构误差重新引导模型关注初始遗漏的模式,并利用平衡共识学习提升鲁棒性、过滤低质量数据。在合成与真实单细胞、空间转录组和 Perturb-seq 数据集上,DR-GEM 在获取可靠嵌入、恢复稀有细胞类型、过滤噪声、缓解细胞与患者层面代表性不足以及发现未见的遗传和空间特征方面优于现有方法。
Apple Machine Learning Research 提出半监督联邦 ASR 方案,通过在线伪标签与服务器端标注数据更新稳定化缩小与全监督联邦学习的差距。在 11 组对比中 9 组超越最强先验方法,域内平均提升 20.8%、跨域 10.0%。教师模型与锚定更新两条轴线相互耦合,锚定更新对数据增强和批量大小高度敏感。
Google Research 推出 MilleMiglia,一个 C++ 实例生成器,用于构建中段物流网络的真实基准。中段物流覆盖区域或大陆尺度的配送中心间运输,占物流成本大头且影响时效,但学术研究长期缺乏公开高质量数据。MilleMiglia 在 GitHub 开源,通过隐私保护的方式捕捉中段运输的多车辆接力、时间窗口与分拣同步等约束,为后续优化研究提供基础。
ConvexGating 从单细胞细胞术数据的聚类结果中推断最优门控策略,旨在将聚类得到的细胞群体转化为可用于分选的高纯度、低步骤门控方案。flow cytometry、mass cytometry(cyTOF)和 CITE-seq 等高维数据场景中,手动门控依赖操作者经验且存在跨操作者变异,而聚类方法虽能无偏分离细胞却难以直接转为分选策略。
summary_zh: 研究团队利用定量方法对死后海马体组织中的阿尔茨海默病病理特征与微胶质细胞激活进行映射分析。数据来自USC ADRC,使用NACC统一数据集,资助方包括NIH、NSF及Chan Zuckerberg Initiative等。
Google Research 评估了将 UK Biobank 欧洲 GWAS 结果迁移至 Biobank Japan 约 20 万日本样本的 PRS 性能,覆盖 BMI、血压、血脂等 8 项临床性状。
MIT 生物系推出 PottsMPNN 机器学习框架,融入物理原理以改进序列生成与突变稳定性预测。该模型通过引入噪声、氨基酸配对分布和进化相关序列训练,更好地理解序列-能量景观,能为无天然对应序列的全新设计结构生成可行序列。研究显示,减少对天然序列的依赖可提升结构兼容性与能量预测精度。
MIT研究人员开发CrysVCD框架,在材料生成初期通过价电子约束规则筛选不稳定结构,与扩散模型和语言模型结合使用。近70%计算生成达到晶格动力学稳定标准,机械稳定性和亚稳性分别达68%和85%,生成效率比事后筛选提高一个数量级。
MIT工程师提出名为η-learning的机器学习方法,可在不含极端事件的历史数据中学习并生成统计上合理的极端情景,如百年一遇暴雨的可能位置、范围和强度。该方法结合点统计与空间地图约束,已应用于美国大陆极端降水模拟,相关论文发表于Nature Communications。
推荐理由:该方法不依赖历史极端事件数据即可生成罕见情景,为城市和金融等领域的风险评估提供了可迁移的新工具。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,把匿名聚合的移动性模式与 Gemini 的文本嵌入对齐,为地点生成兼顾身份与动态功能的嵌入向量。在公开基准上,该方法在访问意图预测上最高取得 81.9% 的相对提升,价格水平分类提升 75.1%,忙碌度估计准确率提升 24.7%。
summary_zh: MIT 研究人员开发了预测电化学合成氨催化剂性能的新方法,通过密度泛函理论模拟替代试错筛选,可在数年内加速寻找使该方法与 Haber-Bosch 工艺具备成本竞争力的催化剂化合物。
Multiverse Computing 提出高效知识蒸馏方法,通过缓存教师模型 top-100 logits 与融合分块 KL 损失,避免构建全词汇表×序列矩阵,在单 H200 上把峰值显存从约 250GB 降至约 58GB,并在 32K 上下文下把蒸馏从四卡节点缩至单卡。代码已开源:github.com/CompactifAI/Full-Chunked-KL-Loss
推荐理由:通过缓存 top-K logits 与融合分块 KL 损失两条改动,把蒸馏显存占用压到单卡可跑,为长上下文蒸馏提供了可复现的低成本路径。
Google Research发布SymptomAI研究,基于Gemini Flash 2.0通过13,917人随机实验表明临床医生在超50%情况下更偏好其鉴别诊断,且主动询问策略显著优于被动回答。
推荐理由:该研究通过一万三千余人的随机对照实验,为对话式AI症状评估提供了与临床医生横向比较的基准数据,并揭示了主动询问策略对诊断准确性的提升作用。
SensorFM 是一个大传感器基础模型,基于超过一万亿分钟、来自五百万参与者的无标注多模态可穿戴数据预训练,在心血管、代谢、睡眠和心理健康等35项判别任务上泛化,且通过 Agent classroom 可自动构建预测头。
Google Research 在 CIDR 发表论文,提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境中测试数月,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总成本降低约 5%,实际 I/O 成本影响仅 0.5%。
Google Research 提出 Regularized f-Divergence Kernel Tests 框架,用于更灵敏、准确地审计机器学习模型的机器遗忘效果,理论上控制假阳性率并使假阴性风险随样本量增加收敛至零。
宾大物理学家 Bo Zhen 团队开发出激子极化激元(exciton-polariton),实现全光开关,仅耗约 4 皮焦耳能量。传统光子芯片在非线性激活步骤需光-电转换,而该技术可避免这一瓶颈,有望降低大 AI 系统的能耗并支持未来芯片上的量子计算功能。
Google DeepMind 提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步计算岛以隔离硬件故障。实验表明,该架构在 2-5 Gbps 广域网上训练 120 亿参数模型,性能与传统方法持平且速度快 20 倍以上,并能混合不同代 TPU 硬件。
Google Research 提出 Simula 框架,将合成数据生成重构为机制设计问题,通过推理驱动实现可控制的数据集构建。论文发表于 Transactions on Machine Learning Research,在网络安全、法律推理、数学等五个领域最多生成 512K 数据点,全系统一致优于简单基线,且高质量数据比单纯增加数量更有效。
Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。
summary_zh: 单细胞测序技术通过测序DNA和RNA在单个细胞层面探索细胞异质性,2013年Nature将其评为年度方法。scRNA-tools数据库截至2021年收录超过1000个分析工具,其中许多利用深度学习技术。
Autoencoder 通过编码器 $g_\phi$ 和解码器 $f_\theta$ 在瓶颈层学习低维隐变量 $\mathbf{z}$,以重构输入 $\mathbf{x} \approx f_\theta(g_\phi(\mathbf{x}))$,并使用 MSE 损失优化。