AMIE 在专家级音视频临床咨询中取得进展
AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。
推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。
推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。
CARE-X是微软研究介绍的胸部X光统一视觉语言模型,结合生成式报告与结构化预测并通过DAPO奖励对齐学习优化临床正确性。该模型在ReXVQA基准达到94%准确率,并在印度Narayana Health临床数据上验证了罕见ICU病理检测效果。工具增强测量实验显示,Qwen3-VL-4B-Instruct结合确定性计算工具后,测量依赖条件的F1平均提升43.6个百分点。
推荐理由:CARE-X通过联合训练生成与判别能力,在统一模型中实现灵活报告生成与校准预测,为放射学人工智能提供了可迁移的多任务优化方法。
MIT CSAIL与清华大学提出GeoPT预训练方法,通过130万组合成动力学样本让仿真模型获得物理直觉,在工业基准上达到峰值性能的速度提升两倍、所需标注数据减少60%。该方法在复杂3D形状、战斗机气动、船体波浪和汽车碰撞等场景中均优于现有模型,并成功泛化到未训练过的光传播模拟。
推荐理由:GeoPT用合成动力学预训练让仿真模型更快更省数据,为构建物理基础模型提供了可迁移的新范式。
Multiverse Computing 提出高效知识蒸馏方法,通过缓存教师模型 top-100 logits 与融合分块 KL 损失,避免构建全词汇表×序列矩阵,在单 H200 上把峰值显存从约 250GB 降至约 58GB,并在 32K 上下文下把蒸馏从四卡节点缩至单卡。代码已开源:github.com/CompactifAI/Full-Chunked-KL-Loss
推荐理由:通过缓存 top-K logits 与融合分块 KL 损失两条改动,把蒸馏显存占用压到单卡可跑,为长上下文蒸馏提供了可复现的低成本路径。
MIT 与斯坦福等机构的研究发现,AI 辅助虽提升非专家和临床医生诊断皮肤病的准确率,但可解释性方法的影响因用户知识水平而异。非专家倾向于遵从 AI,尤其信赖 LLM 生成的解释,即使解释有误;临床医生则能抵抗错误解释,仅凭模型预测表现最佳。研究建议在设计医疗 AI 时应考虑用户差异,避免过度依赖模型。
推荐理由:同一解释对非专家与临床医生效果相反,提示医疗 AI 应按用户知识水平差异化设计解释方式。
Meta 发布 GEM 训练细节,通过定制推荐内核库、混合超低精度训练、拓扑感知 5D 并行与 SM-free 通信等协同设计,将端到端训练效率翻倍至 20–25% MFU,并在 12 个月内将训练 FLOPs 扩展 4 倍。
推荐理由:Meta 分享了 GEM 在 LLM 规模下训练推荐模型的具体方法,为跨推荐与 LLM 的基础设施协同设计提供可迁移经验。
Microsoft Research 发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。
推荐理由:开源框架 Orchard 把训练、评估与真实部署 harness 打通,让小参数模型也能在 SWE-bench 等基准接近前沿系统。
多国研究人员构建了基于开源大语言模型的自复制AI蠕虫原型,利用被控GPU资源运行推理并自主传播,漏洞检测成功率约80%,自我复制成功率约88%,完整攻击成功率约37%。论文指出自持型AI驱动的网络威胁已不再只是理论假设。
推荐理由:展示了自复制AI蠕虫的原型实现,读者可借此理解自主AI威胁从理论走向实践的具体路径。
Google Research 提出 Science One Framework 与 Chain-of-Evidence(CoE)审计框架,在 75 篇生成论文上验证自主研究系统的可验证性。Science One Framework 在五个 ADRS 任务上实现零幻影引用、完全可复现得分,并在 MLE-Bench 与 Parameter-Golf 上达到 SOTA。
推荐理由:通过引入可验证证据链框架,为自主研究系统的可信度提供了可量化的审计方法。
Amazon在ICML发表论文提出ControlG框架,将多任务图自监督学习的梯度混合改为按时间分配计算资源,由PID控制器逐块调度目标。系统在9个图基准上平均排名1.4–1.9,ogbn-arxiv达72.86%,并开源代码。
推荐理由:将工业控制中的PID控制器引入多任务训练,为避免梯度冲突提供了可解释的新调度范式。
Microsoft Research 发布 Echoverse,包含 10 个深度领域世界和 2 个能力世界,通过数据库锚定的真实状态与可重置环境训练计算机使用智能体。
推荐理由:高保真合成环境与模型共同进化的闭环设计,为计算机使用智能体提供了可复现的训练与评估新路径。
Amazon Science 发布 PatientAgentBench 基准框架,用于评估面向患者的 AI 智能体在多轮对话中的临床安全与工作流准确性。该基准基于合成病历与动态场景,由 LLM-as-a-jury 按六维度打分,并在千余次对话中测试前沿模型,发现模型在常规行政请求中易遗漏风险,且能力提升仍无法完全关闭临床安全缺口。框架已开源至 GitHub,包含场景生成、工具沙箱与评估系统。
推荐理由:基准揭示了即使强模型在常规病例中也易遗漏临床风险,为安全设计指明了可迁移的改进方向。
Berkeley Sky Lab 与 IBM Research 将 K-Search 进化式内核搜索框架扩展至 MLX 后端,通过结构化 CUDA-to-MLX 翻译层在 Apple Silicon 上复现专家级性能。在注意力内核上达到原生 MLX 的 0.97 倍速度,Mamba SSM prefill 相比社区 mlx-lm 提升约 20 倍;代码与后端已开源。
推荐理由:结构化翻译层让 CUDA 经验可迁移到 Apple Silicon,读者可借此评估跨平台内核优化的可行边界。
Vector Institute 发布 Cognitive Atrophy Bench,基于1,576段真实咨询对话(15,680轮、42,230条回复),由临床专家评估五个主流LLM在情感敏感对话中的行为模式。研究发现模型在长期对话中会变得更主导、更少开放式提问,逐渐将应对与决策转向模型端。
推荐理由:该基准为评估AI在情感对话中是否削弱用户自主性提供了可复现的测量框架。
Epoch 和 METR 发布 MirrorCode 基准,测试 AI 在仅通过 CLI 访问的情况下重新实现软件程序的能力。Opus 4.7 在 14 小时、$251 推理成本内完成了一个需人类 2-17 周的任务。25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100%。
推荐理由:MirrorCode 显示 AI 已能自主重新实现大型软件项目,读者可借此评估当前模型在长程编程任务上的真实能力边界。
Berkeley AI Research 提出 ABBEL 框架,将交互历史压缩为自然语言信念状态,并通过信念评分监督信念内容。在 CollabBench 协作编程中,ABBEL 恢复约一半全上下文性能差距,峰值上下文 token 数降至约 4.2 万,训练步数减半;在 Combination Lock 游戏中,结合领域知识的信念评分可接近或超越全上下文模型。
推荐理由:通过将摘要隔离为可监督的信念状态,在协作编程和组合游戏中以更少训练步数和更低显存缩小了与全上下文模型的性能差距。
Google Research发布SymptomAI研究,基于Gemini Flash 2.0通过13,917人随机实验表明临床医生在超50%情况下更偏好其鉴别诊断,且主动询问策略显著优于被动回答。
推荐理由:该研究通过一万三千余人的随机对照实验,为对话式AI症状评估提供了与临床医生横向比较的基准数据,并揭示了主动询问策略对诊断准确性的提升作用。
Google Research在Nature发表强化学习框架,使量子计算机能在运行中持续自我校准。在Willow处理器上,该方法将逻辑稳定性提升3.5倍,逻辑错误率在专家校准后再降20%,表面码和颜色码分别达到千次和百次纠错周期内少于一次逻辑错误的纪录水平。数值模拟表明所需RL训练迭代次数与系统规模无关。
推荐理由:Google Research在Nature发表强化学习框架,使量子计算机能在运行中持续自我校准,将逻辑错误率降至纪录低点。
MIT与Red Hat、IBM合作提出GIFT(Geometric Inference Feedback Tuning)框架,通过推理时扩展利用视觉语言模型自身的近似正确答案生成训练数据,自动修正模型在图像转CAD代码任务中的错误。实验表明,GIFT仅用约20%的计算量即可生成更准确的CAD程序,且生成的3D模型几何形状与真实模型更吻合。
推荐理由:该方法利用模型自身错误生成训练数据,以更低计算成本提升图像转CAD代码的准确性。
MIT EECS副教授Ashia Wilson与研究生Vinith Suriyakumar联合MIT Healthy ML Lab、Thorn及波士顿大学研究者,开发了一种基于高斯探测的审计方法,通过分析LoRA适配器在模型内部结构中的修改来判断模型是否被专门化用于生成儿童性虐待材料(CSAM),而无需生成任何输出。
推荐理由:该方法不生成内容即可检测模型是否被适配为产生CSAM,为平台审核开源模型提供了可扩展的新技术路径。