UK AISI 与 EvalEval 合作让基准测试结果可复现
summary_zh: UK AISI 通过 EvalEval 的 Evaluation Cards 平台公开分享五个基准的评估结果,覆盖 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六个前沿模型,并附带 HealthBench、Humanity's Last Exam、SWE-Bench Pro 等评测的设置与配置信息。
summary_zh: UK AISI 通过 EvalEval 的 Evaluation Cards 平台公开分享五个基准的评估结果,覆盖 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六个前沿模型,并附带 HealthBench、Humanity's Last Exam、SWE-Bench Pro 等评测的设置与配置信息。
Amazon Bio Discovery团队发表三篇论文,分别提出MochiBind结合力预测、CA-MAP可开发性预测和基于智能体的纳米抗体设计流程。MochiBind在跨抗原验证中比结构基线平均提升近10%配对准确率,并在CPU上约13秒完成20万对抗体评分。
推荐理由:三篇论文分别针对抗体设计中的结合力排序、可开发性预测和全流程设计验证,给出了可复现的评估框架与实验结果。
RetroChimera用学习排序融合R-SMILES 2与NeuralLoc的互补预测,改进小分子逆合成预测。10个高难度目标中,其完整路线被接受9条,de novo、editing与NeuralSym分别为5、4、2条。模型发表于Nature并开源实现与权重,能召回稀有反应,也能在专有数据集上零样本迁移和微调。
Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。
推荐理由:把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。
TangleDiff 是一个深度学习框架,用于从头设计具有可编程特性的同源二聚体纠缠蛋白。其在 silico 成功率超过 70%,远高于当前模型约 1%。实验验证的 9 个同源二聚体中有 7 个成功形成水凝胶,且应力松弛动力学与指定的结合能相关。
summary_zh: 研究提出 B-BiLO 框架,在 PDE 逆问题中结合贝叶斯推理与双层局部算子学习,上层用 Hamiltonian Monte Carlo 采样后验参数,下层通过低秩适配(LoRA)微调神经网络近似解算子。
Google Research 推出 MilleMiglia,一个 C++ 实例生成器,用于构建中段物流网络的真实基准。中段物流覆盖区域或大陆尺度的配送中心间运输,占物流成本大头且影响时效,但学术研究长期缺乏公开高质量数据。MilleMiglia 在 GitHub 开源,通过隐私保护的方式捕捉中段运输的多车辆接力、时间窗口与分拣同步等约束,为后续优化研究提供基础。
ReScale4DL 系统评估了图像分辨率对生物图像分割的影响,在分辨率降至原始 6%-25% 的下采样图像上训练 popular architectures,分割准确率最多提升 25% mean IoU 或仅下降不到 5%。下采样同等比例提升了信息吞吐并降低存储与推理时间,为高效、可持续、低成本的生物成像流程提供实用指导。
DSAS 是一种与方法无关的激活转向框架,通过自适应调节转向强度,在仅检测出不需要的行为时才进行干预。该方法在生成时计算上下文相关的缩放因子,可与现有转向方法联合优化,在毒性缓解与效用保持之间取得更好平衡。DSAS 适用于文本到图像扩散模型,计算开销小且能定位需要转向的 token。
OpenAI 声称其最先进 AI 模型解决了 Navier–Stokes 方程相关的千禧年难题,证明该方程在某些情况下会产生奇点,即预测出物理上不可能的无限速度。物理学家和数学家正借助 AI 进一步理解湍流。
推荐理由:AI 证明 Navier–Stokes 方程存在奇点,为流体湍流研究提供了新的数学视角。
ConvexGating 从单细胞细胞术数据的聚类结果中推断最优门控策略,旨在将聚类得到的细胞群体转化为可用于分选的高纯度、低步骤门控方案。flow cytometry、mass cytometry(cyTOF)和 CITE-seq 等高维数据场景中,手动门控依赖操作者经验且存在跨操作者变异,而聚类方法虽能无偏分离细胞却难以直接转为分选策略。
研究人员构建了由多达37,000个智能体组成的“虚拟生物药企”,由一位“首席科学家”统筹,以加速药物发现。相关论文发表于Science(doi:10.1126/science.aeg6779),并有bioRxiv预印本(doi:10.64898/2026.04.20.719538)支持。
推荐理由:虚拟生物药企的规模化智能体架构为AI制药提供了可参考的组织范式。
Apple ML Research 发布 REVERSAL-BENCH 基准,通过连续参数 ρ∈[0,1] 控制环境可逆性,并在八种操作设置、五种物理引擎中提供重置预言机与可恢复性标注。评估显示无重置智能体随 ρ 增大持续陷入不可恢复状态,而回合制智能体保持稳定学习;该失效由不可逆性驱动,而非障碍物复杂度,并存在于完整物理仿真与学习操作策略中。
summary_zh: 研究团队利用定量方法对死后海马体组织中的阿尔茨海默病病理特征与微胶质细胞激活进行映射分析。数据来自USC ADRC,使用NACC统一数据集,资助方包括NIH、NSF及Chan Zuckerberg Initiative等。
Cell 今日发表报告,公布一套面向衰老生物学的人工智能系统,包含基于衰老数据训练的 LLM、17 项基准任务,以及将模型与代理(agent)整合的接口。作者用这些基准评估了专用 LLM 和 OpenAI、DeepSeek 等公司的通用大模型,发现专用模型在多数测试中表现更优。研究指出,衰老尚未有清晰定义,如何训练 AI 理解衰老仍是关键难题。
推荐理由:为衰老生物学专门定制 LLM 与 17 项基准,揭示专用模型在特定领域或优于通用大模型。
MIT与协作机构开发xvr(X-ray volume registration)技术,利用患者术前3D扫描生成数千张合成X射线训练AI模型,可在数秒内将术中2D X射线与3D扫描精准对齐,精度达亚毫米级。 该模型在覆盖多医院、多器官系统的最大真实注册数据集上,比现有AI方法精度提升一个数量级,适配新患者仅需约5分钟。
推荐理由:该方法通过患者特异性合成数据训练,在真实数据集上显著超越现有AI方法,或提升微创手术的安全性与可及性。
Nature 报道了 Miao 等人提出的 Paper2Agent 框架,可自动将科研论文转化为具备问答、方法应用与协作能力的 AI 智能体,提升研究的可复现性与可复用性。
推荐理由:将静态论文转化为可交互的智能体,为研究复用与可复现性提供了新的技术路径。
Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。
推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。
summary_zh: DACA-GRPO 是一种轻量级即插即用的 GRPO 训练增强方法,针对扩散语言模型强化学习中去噪步骤等权处理和均值场似然估计有偏的两大缺陷,引入去噪进度分数与分层掩码似然两个互补机制。
Google Research提出Retrieve-for-Train框架,用离线强化学习发现属性对齐的查询扩展并编译为监督信号,再蒸馏到53.9M参数的扩散检索器,实现单次非自回归查询扇出。实验显示该方法在开放抽象检索和弱监督组合检索上均优于单查询搜索、零样本扩展和Best-of-N基线,同时实现12–20倍的推理加速。
推荐理由:用离线RL把查询分解编译成监督信号,再注入轻量扩散检索器,在保持集合级属性的同时把推理延迟压低一到两个数量级。
Hugging Face 博客介绍 ALTK-Evolve 的一致性指南与一致性分析器:在 AppWorld 上,GPT-4.1 的 ReAct 智能体 Mean@5 为 77.4%,但 Pass^5 仅 53.0%,一致性缺口 24.4 点。
推荐理由:原文给出了可复现的诊断方法与量化结果,读者可据此评估自身智能体在重复任务中的可靠性缺口。
MIT研究人员提出HardFlow算法,通过在生成过程末端而非中间步骤强制硬约束,使扩散模型和流匹配模型在机器人路径规划等安全关键场景中既满足严格约束又提升解质量。实验表明HardFlow在机器人操作、迷宫导航和文本引导图像编辑中实现完美约束满足,并在解质量上持续超越基线,计算时间与多数方法相当或更低。
推荐理由:该方法在部署时即可对预训练生成模型施加硬约束而不重新训练,为机器人等安全关键场景提供了可即插即用的改进路径。
Google Research 提出 ToolGrad 框架,先生成真实的工具使用链再反推用户提示,仅需单步 LLM 调用即可完成标注。
推荐理由:提出 answer-first 的 ToolGrad 框架,以文本梯度迭代构建工具链,为高效生成高质量工具使用数据提供了可迁移的新范式。
Amazon Science 博客介绍论文《What fits (into few tokens) doesn't overfit》,通过 LLM 智能体在 8 个数据集上的实验表明。
推荐理由:通过可重置的LLM实验为机器学习研究智能体为何不过拟合提供了压缩性解释,并给出可复现的验证方法。
OpenAI 发布了一份 AI 生成的 Navier–Stokes 千禧年难题解法,包含说明文档和 Lean 形式化证明。
Google Research 评估了将 UK Biobank 欧洲 GWAS 结果迁移至 Biobank Japan 约 20 万日本样本的 PRS 性能,覆盖 BMI、血压、血脂等 8 项临床性状。
Google Research与HHMI Janelia及剑桥合作者发布完整雄性果蝇大脑和中枢神经系统连接组,包含166,000个神经元和1.25亿个突触连接,是迄今最大脑图谱。研究利用AI和计算技术构建细胞级全脑图谱,配套Neuroglancer开源可视化工具,并已用于视觉、味觉和社会行为研究。
CMU 机器人研究所推出 Text2TactileGraphics,把文本提示转为带有形状、纹理和盲文的 3D 打印触觉图形,帮助盲人或低视力用户通过触摸理解视觉信息。系统接受简短描述或在线纹理库,并支持触觉传感器捕捉实物表面细节;已在 VisAbility Pittsburgh 和宾州可访问媒体图书馆进行用户测试,相关论文被 ECCV 2026 接收。
MIT与Motional研究人员提出Concept-Wrapper Network(CW-Net),可实时将自动驾驶规划模型的内部推理转化为如接近静止车辆、靠近骑行者等可理解概念,并强制规划器使用这些概念做决策,从而忠实解释车辆行为且不改变驾驶性能。
推荐理由:该研究为自动驾驶黑箱决策提供了可实时解释的模块,有助于人类预判车辆行为并辅助工程调试。
Allen AI 提出 BenchMIRT,用多维项目反应理论逐题审计 LLM 基准,从 100 个模型、16 个基准、34K+ 题中独立恢复出安全与推理两个维度。分析显示 BBQ、WMDP 等基准的得分更依赖推理能力;保留 10% 题目仍能维持排名,模型在未见过题目上的预测准确率达 79%。
MIT 生物系推出 PottsMPNN 机器学习框架,融入物理原理以改进序列生成与突变稳定性预测。该模型通过引入噪声、氨基酸配对分布和进化相关序列训练,更好地理解序列-能量景观,能为无天然对应序列的全新设计结构生成可行序列。研究显示,减少对天然序列的依赖可提升结构兼容性与能量预测精度。
Google Earth AI推出实验性行星预测引擎(PPE),可根据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将原本数周的手动流程压缩至分钟级。
推荐理由:原文展示了自主地理空间建模工作流,读者可据此理解AI如何缩短从数据发现到模型训练的周期。
Amazon Science 提出基于 Ising 模型的依赖感知聚合方法,在相关性、毒性、摘要三任务上相对加权多数投票提升 9%–14%。该方法通过建模评判者之间的成对依赖关系,在无监督设置下利用评估日志中的同意与分歧模式调整聚合权重。
推荐理由:原文给出了依赖感知聚合方法与多数投票的对比结果,读者可据此判断是否需要重新审视现有 LLM-as-a-judge 评估流程。
MIT研究人员开发CrysVCD框架,在材料生成初期通过价电子约束规则筛选不稳定结构,与扩散模型和语言模型结合使用。近70%计算生成达到晶格动力学稳定标准,机械稳定性和亚稳性分别达68%和85%,生成效率比事后筛选提高一个数量级。
Google Research 在 CHI 2026 发表 AgentHands 原型,利用 XR 空间理解能力为 AI 智能体添加与语音同步的手部手势。系统包含环境感知、手势事件库、嵌入手势的推理和同步执行模块,在 12 人用户研究中相比纯语音基线显著提升了空间定位、复杂动作理解、安全提示效果并降低了认知负荷。
Multiverse Computing 提出 QAH 方法,对 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 后,在 9 项基准中 7 项超越原 bfloat16 检查点,并在 LiveCodeBench 上超过 120B 原版教师模型。
推荐理由:原文给出了压缩-量化-恢复流程的对比,读者可据此判断 QAH 在训练稳定性与推理成本上的实际收益。
MIT工程师提出名为η-learning的机器学习方法,可在不含极端事件的历史数据中学习并生成统计上合理的极端情景,如百年一遇暴雨的可能位置、范围和强度。该方法结合点统计与空间地图约束,已应用于美国大陆极端降水模拟,相关论文发表于Nature Communications。
推荐理由:该方法不依赖历史极端事件数据即可生成罕见情景,为城市和金融等领域的风险评估提供了可迁移的新工具。
Amazon 发布开源基准 SOP-Bench,覆盖 12 个业务领域、2000+ 任务,把专家撰写的真实 SOP 与工具及答案对齐来评估智能体。实验显示升级模型未必提升表现、工具过多会降低成功率,且没有一种模型+智能体组合在所有流程中占优。
推荐理由:原文给出基线模型在真实业务 SOP 上的失败模式,读者可据此判断自研智能体在部署前应重点测试哪些环节。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,把匿名聚合的移动性模式与 Gemini 的文本嵌入对齐,为地点生成兼顾身份与动态功能的嵌入向量。在公开基准上,该方法在访问意图预测上最高取得 81.9% 的相对提升,价格水平分类提升 75.1%,忙碌度估计准确率提升 24.7%。
Hugging Face 提出三种测试量化语音 ASR 模型的基准优化行为,评估了 11 个开源模型,发现高分模型在 VoxPopuli 和 LibriSpeech 上会复现基准错误转录、恢复被掩码数字,并依据声学线索切换拼写变体。相关脚本和未归一化输出已开源。
推荐理由:原文给出三种可复现的测试方法,读者可据此自行评估语音模型在真实场景中的泛化能力。