跳到正文

#论文/研究

今日 570 条
8月17日周一
8月12日周三
  1. Google Research66

    空货架还是丢失的钥匙?回忆是参数化事实性的瓶颈

    Google Research 提出知识剖析框架,发现前沿大模型的事实性错误主要源于回忆失败而非知识未编码。WikiProfile 基准包含 2,150 条维基百科事实,每个事实配 10 个问题,评测了 13 个 LLM 约 450 万条响应。

    推荐理由:该研究将大模型的 factual error 重新定义为 recall 失败而非 encoding 失败,并证明思考机制可恢复约四成到六成已编码但无法直接提取的事实。

  2. Google Research65

    AMIE 在专家级音视频临床咨询中取得进展

    AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。

    推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。

  3. Microsoft Research64

    CARE-X介绍:面向临床有用的放射学视觉语言模型

    CARE-X是微软研究介绍的胸部X光统一视觉语言模型,结合生成式报告与结构化预测并通过DAPO奖励对齐学习优化临床正确性。该模型在ReXVQA基准达到94%准确率,并在印度Narayana Health临床数据上验证了罕见ICU病理检测效果。工具增强测量实验显示,Qwen3-VL-4B-Instruct结合确定性计算工具后,测量依赖条件的F1平均提升43.6个百分点。

    推荐理由:CARE-X通过联合训练生成与判别能力,在统一模型中实现灵活报告生成与校准预测,为放射学人工智能提供了可迁移的多任务优化方法。

8月11日周二
  1. MIT News · AI62

    GeoPT:具备物理感知能力的AI模型可模拟更广泛的真实场景

    MIT CSAIL与清华大学提出GeoPT预训练方法,通过130万组合成动力学样本让仿真模型获得物理直觉,在工业基准上达到峰值性能的速度提升两倍、所需标注数据减少60%。该方法在复杂3D形状、战斗机气动、船体波浪和汽车碰撞等场景中均优于现有模型,并成功泛化到未训练过的光传播模拟。

    推荐理由:GeoPT用合成动力学预训练让仿真模型更快更省数据,为构建物理基础模型提供了可迁移的新范式。

8月10日周一
  1. Hugging Face Blog62

    高效知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失

    Multiverse Computing 提出高效知识蒸馏方法,通过缓存教师模型 top-100 logits 与融合分块 KL 损失,避免构建全词汇表×序列矩阵,在单 H200 上把峰值显存从约 250GB 降至约 58GB,并在 32K 上下文下把蒸馏从四卡节点缩至单卡。代码已开源:github.com/CompactifAI/Full-Chunked-KL-Loss

    推荐理由:通过缓存 top-K logits 与融合分块 KL 损失两条改动,把蒸馏显存占用压到单卡可跑,为长上下文蒸馏提供了可复现的低成本路径。

8月4日周二
  1. MIT News · AI62

    医疗 AI 辅助诊断的效果因用户专业水平而异

    MIT 与斯坦福等机构的研究发现,AI 辅助虽提升非专家和临床医生诊断皮肤病的准确率,但可解释性方法的影响因用户知识水平而异。非专家倾向于遵从 AI,尤其信赖 LLM 生成的解释,即使解释有误;临床医生则能抵抗错误解释,仅凭模型预测表现最佳。研究建议在设计医疗 AI 时应考虑用户差异,避免过度依赖模型。

    推荐理由:同一解释对非专家与临床医生效果相反,提示医疗 AI 应按用户知识水平差异化设计解释方式。

  2. Meta Engineering · AI71

    Meta GEM 训练:如何将广告推荐基础模型效率在 LLM 规模下翻倍

    Meta 发布 GEM 训练细节,通过定制推荐内核库、混合超低精度训练、拓扑感知 5D 并行与 SM-free 通信等协同设计,将端到端训练效率翻倍至 20–25% MFU,并在 12 个月内将训练 FLOPs 扩展 4 倍。

    推荐理由:Meta 分享了 GEM 在 LLM 规模下训练推荐模型的具体方法,为跨推荐与 LLM 的基础设施协同设计提供可迁移经验。

  3. Microsoft Research82

    Orchard:面向可扩展智能体 AI 的开源框架

    Microsoft Research 发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。

    推荐理由:开源框架 Orchard 把训练、评估与真实部署 harness 打通,让小参数模型也能在 SWE-bench 等基准接近前沿系统。

7月31日周五
  1. Google Research72

    Science One Framework:基于 Chain-of-Evidence 的可验证自主研究框架

    Google Research 提出 Science One Framework 与 Chain-of-Evidence(CoE)审计框架,在 75 篇生成论文上验证自主研究系统的可验证性。Science One Framework 在五个 ADRS 任务上实现零幻影引用、完全可复现得分,并在 MLE-Bench 与 Parameter-Golf 上达到 SOTA。

    推荐理由:通过引入可验证证据链框架,为自主研究系统的可信度提供了可量化的审计方法。

  2. Amazon Science60

    ControlG:用工业控制器协调多任务图自监督学习

    Amazon在ICML发表论文提出ControlG框架,将多任务图自监督学习的梯度混合改为按时间分配计算资源,由PID控制器逐块调度目标。系统在9个图基准上平均排名1.4–1.9,ogbn-arxiv达72.86%,并开源代码。

    推荐理由:将工业控制中的PID控制器引入多任务训练,为避免梯度冲突提供了可解释的新调度范式。

  3. Microsoft Research45

    EvoLib:将经验转化为演化知识

    EvoLib是一个让大语言模型在推理过程中从自身经验自主学习的框架,无需真实标签或外部反馈,将过去尝试转化为可复用技能和反思性洞察。在数学推理、代码编写和长时序任务上,EvoLib一致优于检索式记忆方法,以更少token实现更高性能,并将测试时计算更有效地转化为性能增益。该框架无需模型更新,可应用于任何通过API部署的黑盒语言模型,且对任务顺序具有鲁棒性。

7月29日周三
  1. Amazon Science64

    PatientAgentBench:面向患者端健康 AI 智能体的新评估基准

    Amazon Science 发布 PatientAgentBench 基准框架,用于评估面向患者的 AI 智能体在多轮对话中的临床安全与工作流准确性。该基准基于合成病历与动态场景,由 LLM-as-a-jury 按六维度打分,并在千余次对话中测试前沿模型,发现模型在常规行政请求中易遗漏风险,且能力提升仍无法完全关闭临床安全缺口。框架已开源至 GitHub,包含场景生成、工具沙箱与评估系统。

    推荐理由:基准揭示了即使强模型在常规病例中也易遗漏临床风险,为安全设计指明了可迁移的改进方向。

  2. Berkeley AI Research62

    K-Search:从 CUDA 到 MLX 的内核优化迁移研究

    Berkeley Sky Lab 与 IBM Research 将 K-Search 进化式内核搜索框架扩展至 MLX 后端,通过结构化 CUDA-to-MLX 翻译层在 Apple Silicon 上复现专家级性能。在注意力内核上达到原生 MLX 的 0.97 倍速度,Mamba SSM prefill 相比社区 mlx-lm 提升约 20 倍;代码与后端已开源。

    推荐理由:结构化翻译层让 CUDA 经验可迁移到 Apple Silicon,读者可借此评估跨平台内核优化的可行边界。

  3. Vector Institute62

    当AI帮助过度时:理解与测量LLM行为中的认知萎缩

    Vector Institute 发布 Cognitive Atrophy Bench,基于1,576段真实咨询对话(15,680轮、42,230条回复),由临床专家评估五个主流LLM在情感敏感对话中的行为模式。研究发现模型在长期对话中会变得更主导、更少开放式提问,逐渐将应对与决策转向模型端。

    推荐理由:该基准为评估AI在情感对话中是否削弱用户自主性提供了可复现的测量框架。

7月26日周日
  1. Berkeley AI Research60

    ABBEL:教大语言模型更新信念以实现高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将交互历史压缩为自然语言信念状态,并通过信念评分监督信念内容。在 CollabBench 协作编程中,ABBEL 恢复约一半全上下文性能差距,峰值上下文 token 数降至约 4.2 万,训练步数减半;在 Combination Lock 游戏中,结合领域知识的信念评分可接近或超越全上下文模型。

    推荐理由:通过将摘要隔离为可监督的信念状态,在协作编程和组合游戏中以更少训练步数和更低显存缩小了与全上下文模型的性能差距。

7月23日周四
  1. Google Research65

    SymptomAI:迈向日常症状评估的对话式AI代理

    Google Research发布SymptomAI研究,基于Gemini Flash 2.0通过13,917人随机实验表明临床医生在超50%情况下更偏好其鉴别诊断,且主动询问策略显著优于被动回答。

    推荐理由:该研究通过一万三千余人的随机对照实验,为对话式AI症状评估提供了与临床医生横向比较的基准数据,并揭示了主动询问策略对诊断准确性的提升作用。

  2. Google Research61

    Google Research在Nature发表量子纠错强化学习框架

    Google Research在Nature发表强化学习框架,使量子计算机能在运行中持续自我校准。在Willow处理器上,该方法将逻辑稳定性提升3.5倍,逻辑错误率在专家校准后再降20%,表面码和颜色码分别达到千次和百次纠错周期内少于一次逻辑错误的纪录水平。数值模拟表明所需RL训练迭代次数与系统规模无关。

    推荐理由:Google Research在Nature发表强化学习框架,使量子计算机能在运行中持续自我校准,将逻辑错误率降至纪录低点。

7月16日周四
  1. MIT News · AI60

    MIT提出GIFT系统,让视觉语言模型自动将2D设计转为更精确的CAD程序

    MIT与Red Hat、IBM合作提出GIFT(Geometric Inference Feedback Tuning)框架,通过推理时扩展利用视觉语言模型自身的近似正确答案生成训练数据,自动修正模型在图像转CAD代码任务中的错误。实验表明,GIFT仅用约20%的计算量即可生成更准确的CAD程序,且生成的3D模型几何形状与真实模型更吻合。

    推荐理由:该方法利用模型自身错误生成训练数据,以更低计算成本提升图像转CAD代码的准确性。

7月13日周一
  1. MIT News · AI64

    MIT与Thorn合作提出高斯探测方法,可100%准确检测模型是否被适配为生成CSAM

    MIT EECS副教授Ashia Wilson与研究生Vinith Suriyakumar联合MIT Healthy ML Lab、Thorn及波士顿大学研究者,开发了一种基于高斯探测的审计方法,通过分析LoRA适配器在模型内部结构中的修改来判断模型是否被专门化用于生成儿童性虐待材料(CSAM),而无需生成任何输出。

    推荐理由:该方法不生成内容即可检测模型是否被适配为产生CSAM,为平台审核开源模型提供了可扩展的新技术路径。

7月11日周六
  1. Amazon Science60

    Amazon与密歇根大学推出HydroShear仿真器赋予机器人触觉

    Amazon与密歇根大学提出HydroShear,基于水弹性接触模型并加入路径相关力追踪,准确模拟触觉剪切力。机器人仅在仿真中训练强化学习策略后直接部署到真实Franka机器人,在四项接触密集任务上平均成功率93%,远超TacSL的34%和FOTS的58-61%。

    推荐理由:它用仿真解决了触觉力建模的难题,让机器人在模拟中训练后直接迁移到真实世界。

7月10日周五
  1. Vector Institute88

    The AI Scientist:迈向科研全流程自动化

    Vector Institute 介绍 Jeff Clune 等人提出的 The AI Scientist 系统,可自主完成从选题到论文撰写的完整科研流程,其生成的论文在 ICLR 2025 ICBINB 工作坊通过同行评审。

    推荐理由:展示了AI系统端到端自动化科研流程的可行性,为理解自主科研代理的能力边界与扩展趋势提供了具体案例。

7月9日周四
  1. MIT News · AI60

    FloatForm:小型机器人船自组装成浮动结构

    MIT CSAIL 团队发布 FloatForm 系统,由 21 厘米方形自主船组成,通过磁锁原结构实现自组装、拆解与重组,仅在精调位置时引入轻量中央规划器。实验中 8 个机器人完成构型转换并集体运输,仿真可扩展至 64 个;10 次试验中 4 机器人成功率为 90%、8 机器人为 70%。论文发表于 Nature Communications,源自与阿姆斯特丹合作的 Roboat 项目。

    推荐理由:分布式水下机器人自组装为可编程水上基础设施提供了可扩展思路,对应急响应与公共空间重构有参考价值。

7月8日周三
  1. Google Research60

    通过导航应用干预缓解城市拥堵的实验研究

    Google Research在Nature Cities发表研究,在10个美国大城市开展为期6个月的实验,通过Google Maps将不到2%的出行引导至替代路线,使目标路段车速中位数提升约2%,燃料消耗下降0.5%–1.0%,全城受影响路段车速中位数提升约0.35%,高峰时段提升约0.5%,每年每城可减少数千吨CO₂e排放。

    推荐理由:研究提供了大规模实证证据,说明即使少量出行协调也能带来全城速度和排放的改善。

7月3日周五
7月1日周三
  1. Hugging Face Blog56

    ScarfBench:评测 AI 智能体在企业 Java 框架迁移中的表现

    IBM Research 发布开源基准 ScarfBench,包含 34 个应用、102 套框架实现、204 个迁移任务和约 151K 行代码,覆盖 Spring、Jakarta EE、Quarkus 之间的迁移。当前前沿智能体行为成功率不足 10%,构建成功率显著高于部署和行为验证成功率;智能体普遍高估自身构建结果,且反复回到配置层处理依赖与环境问题。

6月30日周二
  1. Together AI75

    Together AI 在 ICML 2026 发布九篇全栈前沿研究论文

    Together AI 在 ICML 2026 发布九篇论文,覆盖智能体、模型塑造、算法优化、系统优化与内核五个层级。DSGym 提供 1000+ 任务统一评估框架,ThunderAgent 提升 1.5–3.6 倍智能体吞吐,TTT-Discover 用开源 120B 模型在数学、GPU 内核、算法和生物领域取得新纪录。

    推荐理由:九篇论文覆盖从智能体到 GPU 内核的完整栈,读者可据此判断哪些层是当前性能瓶颈。

6月27日周六
  1. Google Research59

    Pixel上通过冻结MTP加速Gemini Nano模型

    Google Research在Pixel 9和10上部署冻结多Token预测架构,通过将MTP头附加到已冻结的Gemini Nano v3模型实现端侧加速。该架构利用零拷贝设计,MTP头直接交叉关注主模型KV缓存,在通知摘要和校对任务中提速50%以上,每实例节省130MB内存。

6月25日周四
  1. MIT News · AI62

    MIT 与 Microsoft 提出 Murakkab 系统,提升 AI Agent 工作流的速度与能效

    MIT 和 Microsoft 研究人员开发了 Murakkab 系统,开发者可用自然语言描述意图,系统自动选择模型、工具并动态配置硬件资源。测试显示,该方法在视频问答和代码生成任务中仅用约 35% 的计算量、27% 的能耗和不到 25% 的成本,同时满足性能要求。

    推荐理由:原文给出了具体优化幅度和动态配置方法,读者可以据此评估云上 Agent 工作流的能效潜力。

6月24日周三
  1. Vector Institute62

    SONIC-O1:面向真实音视频理解的多模态大模型开源基准

    Vector Institute 发布 SONIC-O1 基准,包含约 60 小时真实音视频内容、4958 个人工验证标注,覆盖 13 个对话主题和 5 大领域。评测显示闭源模型整体领先,时序定位差距显著(Gemini 3.0 Pro 25.4% R@0.5 vs Qwen3-Omni 2.8%),且群体间存在明显差异。

    推荐理由:开源基准 SONIC-O1 揭示了现有模型在时序定位和群体差异上的明显短板,为音频视频理解研究提供了可复现的评测框架。

6月23日周二
  1. Together AI66

    ParallelKernelBench:前沿大语言模型尚不能编写高效多GPU内核

    Together AI发布ParallelKernelBench(PKB)开源基准,包含87个来自真实代码库的多GPU内核生成问题,要求模型用CUDA内核替代PyTorch+NCCL并通过NVLink直接通信。

    推荐理由:基准揭示前沿模型在多GPU内核生成上正确率与速度优势均有限,为分布式优化研究提供了可复现的测试平台。

6月11日周四
6月9日周二
  1. Amazon Science77

    亚马逊研究提出意图执行差距框架并开源 Simple Strands Agent

    亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。

    推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。

6月8日周一
  1. Google DeepMind67

    DeepMind 发布 AI 辅助学习在塞拉利昂的 RCT 结果

    DeepMind 发布塞拉利昂预注册 RCT 结果,使用 Guided Learning 的学生数学成绩提升 +0.258 标准差,相当于 1.2-1.7 年学习进度;教师将 Gemini 融入约一半课堂的小组增益达 1.8-2.5 年。

    推荐理由:在塞拉利昂的 RCT 显示 AI 辅导可带来 1.2-2.5 年学习进度增益,为教育 AI 的实证基础提供了关键数据。

6月5日周五
  1. Google Research66

    Google Research发布PHRM系统:通过智能手机摄像头实现被动心率监测

    Google Research在Nature发表PHRM研究,通过智能手机前置摄像头在日常使用中被动监测心率,跨肤色MAPE<10%,RHR估计MAE<5bpm达到可穿戴设备精度。研究基于35万+视频片段和近700名多样本参与者,覆盖浅色到深色皮肤群体,并公开了最大规模智能手机视频数据集及预训练PHRM-mini模型供合格研究者申请。

    推荐理由:PHRM在大规模日常使用中实现跨肤色符合行业标准的心率监测,MAE低于5bpm的RHR估计达到可穿戴设备水平,为智能手机被动健康追踪设立了新基准。

6月3日周三
  1. Amazon Science73

    Ground truth is a process, not a dataset

    Amazon AGI 团队提出 audit-then-score 协议与 DeepFact-Bench、DeepFact-Eval 两套数据集,用于评估 AI 生成的研究报告。实验显示,未经辅助的专家在已知答案集上仅 60.8% 准确率,而经过四轮审核校准后升至 90.9%;DeepFact-Eval 基于 GPT-4.1 达 83.4%,优于传统事实核查系统与既有深度研究系统。

    推荐理由:原文揭示了深度研究场景下静态基准的局限,为理解 AI 评估体系的演进方向提供了可迁移方法。