跳到正文

#论文/研究

今日 43 条
9月21日周一
9月19日周六
  1. Google Research34

    MilleMiglia:面向中段物流的真实实例生成器

    Google Research 推出 MilleMiglia,一个 C++ 实例生成器,用于构建中段物流网络的真实基准。中段物流覆盖区域或大陆尺度的配送中心间运输,占物流成本大头且影响时效,但学术研究长期缺乏公开高质量数据。MilleMiglia 在 GitHub 开源,通过隐私保护的方式捕捉中段运输的多车辆接力、时间窗口与分拣同步等约束,为后续优化研究提供基础。

9月18日周五
  1. Nature · Machine Learning28

    ReScale4DL:平衡像素与上下文信息以增强生物图像分割

    ReScale4DL 系统评估了图像分辨率对生物图像分割的影响,在分辨率降至原始 6%-25% 的下采样图像上训练 popular architectures,分割准确率最多提升 25% mean IoU 或仅下降不到 5%。下采样同等比例提升了信息吞吐并降低存储与推理时间,为高效、可持续、低成本的生物成像流程提供实用指导。

  2. Apple Machine Learning Research34

    Dynamically Scaled Activation Steering(DSAS)方法解析

    DSAS 是一种与方法无关的激活转向框架,通过自适应调节转向强度,在仅检测出不需要的行为时才进行干预。该方法在生成时计算上下文相关的缩放因子,可与现有转向方法联合优化,在毒性缓解与效用保持之间取得更好平衡。DSAS 适用于文本到图像扩散模型,计算开销小且能定位需要转向的 token。

  3. Nature · Machine Learning72

    AI 破解 Navier–Stokes 挑战:对物理学意味着什么

    OpenAI 声称其最先进 AI 模型解决了 Navier–Stokes 方程相关的千禧年难题,证明该方程在某些情况下会产生奇点,即预测出物理上不可能的无限速度。物理学家和数学家正借助 AI 进一步理解湍流。

    推荐理由:AI 证明 Navier–Stokes 方程存在奇点,为流体湍流研究提供了新的数学视角。

  4. Nature · Machine Learning26

    ConvexGating 从单细胞细胞术聚类中推断门控策略

    ConvexGating 从单细胞细胞术数据的聚类结果中推断最优门控策略,旨在将聚类得到的细胞群体转化为可用于分选的高纯度、低步骤门控方案。flow cytometry、mass cytometry(cyTOF)和 CITE-seq 等高维数据场景中,手动门控依赖操作者经验且存在跨操作者变异,而聚类方法虽能无偏分离细胞却难以直接转为分选策略。

9月17日周四
  1. Nature · Machine Learning65

    AI团队以虚拟生物药企发现潜在肺癌药物

    研究人员构建了由多达37,000个智能体组成的“虚拟生物药企”,由一位“首席科学家”统筹,以加速药物发现。相关论文发表于Science(doi:10.1126/science.aeg6779),并有bioRxiv预印本(doi:10.64898/2026.04.20.719538)支持。

    推荐理由:虚拟生物药企的规模化智能体架构为AI制药提供了可参考的组织范式。

  2. Apple Machine Learning Research58

    REVERSAL-BENCH:可逆性轴与重置预言机,测量无重置强化学习的悬崖

    Apple ML Research 发布 REVERSAL-BENCH 基准,通过连续参数 ρ∈[0,1] 控制环境可逆性,并在八种操作设置、五种物理引擎中提供重置预言机与可恢复性标注。评估显示无重置智能体随 ρ 增大持续陷入不可恢复状态,而回合制智能体保持稳定学习;该失效由不可逆性驱动,而非障碍物复杂度,并存在于完整物理仿真与学习操作策略中。

  3. Nature · Machine Learning62

    AI 衰老研究新工具:专用大语言模型与 17 项基准发布

    Cell 今日发表报告,公布一套面向衰老生物学的人工智能系统,包含基于衰老数据训练的 LLM、17 项基准任务,以及将模型与代理(agent)整合的接口。作者用这些基准评估了专用 LLM 和 OpenAI、DeepSeek 等公司的通用大模型,发现专用模型在多数测试中表现更优。研究指出,衰老尚未有清晰定义,如何训练 AI 理解衰老仍是关键难题。

    推荐理由:为衰老生物学专门定制 LLM 与 17 项基准,揭示专用模型在特定领域或优于通用大模型。

9月16日周三
  1. MIT News · AI72

    MIT团队提出xvr技术:术中X射线与术前3D扫描亚毫米级精准配准

    MIT与协作机构开发xvr(X-ray volume registration)技术,利用患者术前3D扫描生成数千张合成X射线训练AI模型,可在数秒内将术中2D X射线与3D扫描精准对齐,精度达亚毫米级。 该模型在覆盖多医院、多器官系统的最大真实注册数据集上,比现有AI方法精度提升一个数量级,适配新患者仅需约5分钟。

    推荐理由:该方法通过患者特异性合成数据训练,在真实数据集上显著超越现有AI方法,或提升微创手术的安全性与可及性。

  2. Nature · Machine Learning74

    Paper2Agent:将科研论文转化为交互式 AI 智能体

    Nature 报道了 Miao 等人提出的 Paper2Agent 框架,可自动将科研论文转化为具备问答、方法应用与协作能力的 AI 智能体,提升研究的可复现性与可复用性。

    推荐理由:将静态论文转化为可交互的智能体,为研究复用与可复现性提供了新的技术路径。

  3. Apple Machine Learning Research73

    Shared Selective Persistent Memory for Agentic LLM Systems

    Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。

    推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。

  4. Google Research62

    Retrieve-for-Train:绕过推理瓶颈,加速复杂AI搜索

    Google Research提出Retrieve-for-Train框架,用离线强化学习发现属性对齐的查询扩展并编译为监督信号,再蒸馏到53.9M参数的扩散检索器,实现单次非自回归查询扇出。实验显示该方法在开放抽象检索和弱监督组合检索上均优于单查询搜索、零样本扩展和Best-of-N基线,同时实现12–20倍的推理加速。

    推荐理由:用离线RL把查询分解编译成监督信号,再注入轻量扩散检索器,在保持集合级属性的同时把推理延迟压低一到两个数量级。

  5. Hugging Face Blog74

    ALTK-Evolve 一致性指南:智能体任务通过率平均与全通过间的差距及诊断修复方法

    Hugging Face 博客介绍 ALTK-Evolve 的一致性指南与一致性分析器:在 AppWorld 上,GPT-4.1 的 ReAct 智能体 Mean@5 为 77.4%,但 Pass^5 仅 53.0%,一致性缺口 24.4 点。

    推荐理由:原文给出了可复现的诊断方法与量化结果,读者可据此评估自身智能体在重复任务中的可靠性缺口。

9月15日周二
9月14日周一
  1. MIT News · AI62

    MIT提出HardFlow方法使生成AI适用于安全关键场景

    MIT研究人员提出HardFlow算法,通过在生成过程末端而非中间步骤强制硬约束,使扩散模型和流匹配模型在机器人路径规划等安全关键场景中既满足严格约束又提升解质量。实验表明HardFlow在机器人操作、迷宫导航和文本引导图像编辑中实现完美约束满足,并在解质量上持续超越基线,计算时间与多数方法相当或更低。

    推荐理由:该方法在部署时即可对预训练生成模型施加硬约束而不重新训练,为机器人等安全关键场景提供了可即插即用的改进路径。

9月13日周日
9月11日周五
  1. ScienceDaily · AI62

    科学家实现量子操作提速千倍

    瑞典查尔姆斯理工大学研究团队提出基于量子格点门的单周期Floquet控制方法,可在单次驱动周期内完成玻色子编码的多种量子操作,比传统数千次循环提速千倍以上。该方法专为超导量子计算机平台设计,有望降低环境干扰导致的错误累积,推动容错量子计算发展。相关论文已发表于《Physical Review Letters》。

9月10日周四
9月8日周二
9月4日周五
9月2日周三
  1. MIT News · AI62

    CW-Net系统帮助人类预判自动驾驶汽车何时会犯错

    MIT与Motional研究人员提出Concept-Wrapper Network(CW-Net),可实时将自动驾驶规划模型的内部推理转化为如接近静止车辆、靠近骑行者等可理解概念,并强制规划器使用这些概念做决策,从而忠实解释车辆行为且不改变驾驶性能。

    推荐理由:该研究为自动驾驶黑箱决策提供了可实时解释的模块,有助于人类预判车辆行为并辅助工程调试。

  2. Hugging Face Blog56

    BenchMIRT:LLM 基准实际上在测量什么?

    Allen AI 提出 BenchMIRT,用多维项目反应理论逐题审计 LLM 基准,从 100 个模型、16 个基准、34K+ 题中独立恢复出安全与推理两个维度。分析显示 BBQ、WMDP 等基准的得分更依赖推理能力;保留 10% 题目仍能维持排名,模型在未见过题目上的预测准确率达 79%。

8月31日周一
  1. ScienceDaily · AI60

    量子浴实现量子纠缠全自动化

    奥地利ISTA团队利用由关联光子构成的量子浴,首次实验实现了两个分离量子比特之间的全自动纠缠,无需主动控制或重复测量。该原型验证了20年前提出的理论,尽管当前纠缠传输效率约10%,但为可扩展的分布式量子处理器和量子网络提供了新基础。

8月30日周日
  1. ScienceDaily · AI82

    IBM 量子计算机用新纠错策略在 15 分钟内解决经典不可解问题

    IBM 与芝加哥大学团队通过新编码量子电路,用 70 个逻辑量子比特完成经典模拟难以处理的任务,耗时约 15 分钟,同时给出高保真度的可验证结果。实验包含约 2415 次逻辑两比特操作和 468 次逻辑 T 门,逻辑错误率比物理错误率低约 10 倍,相关电路与结果已通过 Quantum Advantage Tracker 公开。

    推荐理由:在经典模拟不可行的背景下,提供了可验证的量子优势实验路径。

8月28日周五
  1. MIT News · AI48

    超越自然序列:MIT 推出 PottsMPNN 蛋白质设计框架

    MIT 生物系推出 PottsMPNN 机器学习框架,融入物理原理以改进序列生成与突变稳定性预测。该模型通过引入噪声、氨基酸配对分布和进化相关序列训练,更好地理解序列-能量景观,能为无天然对应序列的全新设计结构生成可行序列。研究显示,减少对天然序列的依赖可提升结构兼容性与能量预测精度。

  2. Google Research60

    行星预测引擎:通过地球AI自动化全球建模

    Google Earth AI推出实验性行星预测引擎(PPE),可根据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将原本数周的手动流程压缩至分钟级。

    推荐理由:原文展示了自主地理空间建模工作流,读者可据此理解AI如何缩短从数据发现到模型训练的周期。

8月27日周四
  1. Amazon Science62

    当 LLM 评判者一致时,我们该相信吗:基于 Ising 模型的依赖感知聚合方法

    Amazon Science 提出基于 Ising 模型的依赖感知聚合方法,在相关性、毒性、摘要三任务上相对加权多数投票提升 9%–14%。该方法通过建模评判者之间的成对依赖关系,在无监督设置下利用评估日志中的同意与分歧模式调整聚合权重。

    推荐理由:原文给出了依赖感知聚合方法与多数投票的对比结果,读者可据此判断是否需要重新审视现有 LLM-as-a-judge 评估流程。

8月26日周三
  1. Google Research52

    AgentHands:为 XR 中基于空间的智能体对话生成交互式手部手势

    Google Research 在 CHI 2026 发表 AgentHands 原型,利用 XR 空间理解能力为 AI 智能体添加与语音同步的手部手势。系统包含环境感知、手势事件库、嵌入手势的推理和同步执行模块,在 12 人用户研究中相比纯语音基线显著提升了空间定位、复杂动作理解、安全提示效果并降低了认知负荷。

8月25日周二
  1. Hugging Face Blog66

    Quantization-Aware Healing:压缩后的 4 位模型超越全精度原版

    Multiverse Computing 提出 QAH 方法,对 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 后,在 9 项基准中 7 项超越原 bfloat16 检查点,并在 LiveCodeBench 上超过 120B 原版教师模型。

    推荐理由:原文给出了压缩-量化-恢复流程的对比,读者可据此判断 QAH 在训练稳定性与推理成本上的实际收益。

  2. MIT News · AI62

    MIT工程师开发η-learning工具,无需极端历史数据即可生成极端事件情景

    MIT工程师提出名为η-learning的机器学习方法,可在不含极端事件的历史数据中学习并生成统计上合理的极端情景,如百年一遇暴雨的可能位置、范围和强度。该方法结合点统计与空间地图约束,已应用于美国大陆极端降水模拟,相关论文发表于Nature Communications。

    推荐理由:该方法不依赖历史极端事件数据即可生成罕见情景,为城市和金融等领域的风险评估提供了可迁移的新工具。