DeepMind 发布 AI 辅助学习在塞拉利昂的 RCT 结果
DeepMind 发布塞拉利昂预注册 RCT 结果,使用 Guided Learning 的学生数学成绩提升 +0.258 标准差,相当于 1.2-1.7 年学习进度;教师将 Gemini 融入约一半课堂的小组增益达 1.8-2.5 年。
推荐理由:在塞拉利昂的 RCT 显示 AI 辅导可带来 1.2-2.5 年学习进度增益,为教育 AI 的实证基础提供了关键数据。
DeepMind 发布塞拉利昂预注册 RCT 结果,使用 Guided Learning 的学生数学成绩提升 +0.258 标准差,相当于 1.2-1.7 年学习进度;教师将 Gemini 融入约一半课堂的小组增益达 1.8-2.5 年。
推荐理由:在塞拉利昂的 RCT 显示 AI 辅导可带来 1.2-2.5 年学习进度增益,为教育 AI 的实证基础提供了关键数据。
Import AI 460 汇总三篇研究:Kings College London 等机构推出 SocioHack 基准,测试 AI 在信用卡积分、成绩等社会场景中利用规则漏洞的能力。
summary_zh: Sebastian Raschka 整理了 2026 年 1 月至 5 月他标记的 LLM 研究论文清单,涵盖架构与模型设计、高效训练与推理、稀疏注意力与长上下文、推理与测试时计算、强化学习、智能体系统、编码智能体、扩散语言模型及评测基准等类别。
Google 推出由 Gemini Enterprise Agent Platform 托管的 Cross-Corpus Retrieval,基于 Agentic RAG 驱动,可处理多源、多跳的复杂查询。
两篇新论文分别从 AI 机制和昆虫神经计算角度提出意识测试指标,而非仅依赖表面行为。ChatGPT 等现有大语言模型的行为表现不构成意识归因的依据,但未来不同架构的 AI 仍可能具备意识。研究者指出,判断意识应关注信息处理方式而非行为表现,人类、昆虫与机器在比较框架上趋于统一。
NVIDIA Nemotron 3 Ultra 现已上线 Ollama 云端,为 550B 总参数、55B 活跃参数的开放模型,专为长程 Agent、编码 Agent 与复杂企业工作流设计,支持 1M 上下文与 NVFP4 推理。
推荐理由:原文给出参数规模与 NVFP4 优化,读者可据此评估它在长程 Agent 工作流中的成本与吞吐表现。
Amazon AGI 团队提出 audit-then-score 协议与 DeepFact-Bench、DeepFact-Eval 两套数据集,用于评估 AI 生成的研究报告。实验显示,未经辅助的专家在已知答案集上仅 60.8% 准确率,而经过四轮审核校准后升至 90.9%;DeepFact-Eval 基于 GPT-4.1 达 83.4%,优于传统事实核查系统与既有深度研究系统。
推荐理由:原文揭示了深度研究场景下静态基准的局限,为理解 AI 评估体系的演进方向提供了可迁移方法。
Google Research 在 I/O 2026 集中发布 Gemini for Science、Google Health 应用、Coralboard、WeatherNext、Groundsource、Gemma V4 等研究驱动产品与开源工具,并开放 Science Skills、Paper Assistant Tool 等实验性能力。
Mistral 将 Le Chat 升级为统一的 AI 智能体 Vibe,同一订阅同时覆盖工作与编码,用户原有的对话、设置和方案自动保留。
推荐理由:Le Chat 升级为 Vibe 后把工作流与编码并入同一智能体和同一订阅,读者可了解其功能边界与定价分层。
summary_zh: Amazon Research Awards(ARA)公布秋季2025评审结果,70位获奖者来自49所大学、11个国家,覆盖AI信息安全、智能体AI、自动化推理、AWS密码学、网络安全与反滥用、可持续性等6个方向。
Mistral 发布 physics AI,将工程仿真从数小时/周缩短到秒级单 GPU 前向传播。整合 Emmi AI 作为企业解决方案中新基础能力,合作伙伴包括 ASML、Airbus、Safran 和 Siemens Energy。覆盖产品设计、工装工艺设计和实时数字孪生三大场景,不是替代传统求解器,而是大幅提升设计迭代吞吐量。
summary_zh: 大量社交媒体评论、学术论文和《纽约时报》专栏文章已由 AI 生成,AI 写作正在造成内容同质化与意义空洞。教育实验显示,直接用 ChatGPT 做作业会导致学生考试表现下降,而个性化 AI 导师可使 Python 成绩提升 0.15 个标准差。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型,具备 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:128B 开源权重模型把编码智能体搬到云端,读者可据此判断自托管与异步并行任务的取舍。
Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。
推荐理由:Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。
Weaviate Blog 发布教程,展示如何利用内置 MCP 服务器搭建代码助手:将代码按语法边界分块注入 CodeChunks,按标题分块注入 DocChunks,通过混合搜索(BM25+向量)让 Claude Code、Cursor、VS Code 调用 weaviate-query-hybrid 获取真实代码引用,而非依赖模型训练数据。
推荐理由:原文给出了一套从零搭建代码助手的方法和脚本,读者可按步骤实操并迁移到自己的代码库。
Google在Nature发表ERA论文并将其作为工具开放,ERA使用Gemini通过树搜索优化科学代码,在基因组学、公共卫生等六类基准上达到专家级性能。ERA已应用于八个科学问题的研究中,涵盖流行病预测、CO2监测、径流预报、太阳能优化和零售预测,并作为Computational Discovery的核心组件通过Gemini for Science逐步开放。
Omar Abudayyeh 和 Jonathan Gootenberg 用 Co-Scientist 扫描数万篇论文,提出 20 多个可逆转衰老的新基因假说,并验证部分成功使细胞恢复年轻状态。Co-Scientist 将大规模筛选数据与文献分析的时间从最多 6 个月缩短到几天。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 三款实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)和桌面端 Science Skills。
推荐理由:原文给出三款实验工具与企业预览入口,读者可据此评估自身研究工作流是否适配。
summary_zh: 剑桥大学 Clare Bryant 教授使用 Google DeepMind 的 Co-Scientist 工具研究病原体跨物种传播引发败血症等疾病的分子开关。
summary_zh: Google DeepMind 推出 AI 研究助手 Co-Scientist,帮助 Calico Life Sciences 的专家整合衰老生物学领域的分散发现,生成可验证的新假设。
summary_zh: 爱丁堡大学生物工程师 Filippo Menolascina 使用 Co-Scientist 梳理文献,针对代谢功能障碍相关脂肪性肝炎(MASH)生成新假设。
MIT 的 Raman 与 Boston Children's Hospital 的 Flynn 利用 Co-Scientist 整合神经组织工程与 RNA 表面图谱技术,快速梳理 ALS 矛盾文献并生成可检验假设。Co-Scientist 帮助研究者按可行性与风险收益排序研究方向,并催化两人合作探索 RNA 机制与潜在 RNA 药物。
斯坦福遗传学家 Gary Peltz 使用 Co-Scientist 从现有药物文献中筛选肝纤维化候选药,Co-Scientist 提出的三种候选药中有两种在人体肝细胞实验中阻断纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的损伤应答。
推荐理由:原文给出 Co-Scientist 在肝纤维化药物筛选中的对比结果,读者可据此评估 AI 科研助手在真实实验中的辅助价值。
Google DeepMind 发布 Gemini 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上表现领先,输出速度比其他前沿模型快 4 倍。
推荐理由:原文给出 Flash 在多个基准上的具体分数与速度倍数,读者可据此对比其与上一代 Pro 的能力变化。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论与演化假设来加速生命科学等领域的科研突破。
推荐理由:原文给出多智能体协作与假设生成引擎的具体阶段,读者可据此评估它对现有科研工作流的实际改变。
Vector Institute 发布两部分Agent评估策略研究,第一部分提出混合评估框架,结合机器可验证结果与LLM-as-judge,并给出NYC Airbnb分析Agent的三种失败模式案例;第二部分通过ICL实验发现系统提示中的
推荐理由:文章给出了多模型ICL实验的误对齐率数据,读者可据此评估自身系统提示中模式跟随类指令的潜在风险。
Google DeepMind 发布 AlphaEvolve,一款由 Gemini 驱动的编程智能体,用于设计高级算法并已在数学、计算机科学和 Google 基础设施中部署。
推荐理由:原文展示了 AlphaEvolve 在数学、量子物理、基础设施和商业场景中的具体提升,读者可据此评估它作为通用算法设计智能体的实际边界。
EPFL Philippe Schwaller 团队在 Matter 发表 Synthegy 框架,将大语言模型作为推理工具指导传统计算搜索。化学家以自然语言给出合成策略(如优先成环、避免保护基),系统评分并解释匹配度,双盲研究中 36 位化学家的评估与系统结果一致率为 71.2%。同一接口也可用于反应机理的电子步骤搜索与条件细化。
Jack Clark在Import AI 455中基于公开基准的聚合趋势,认为AI系统有60%以上概率在2028年底前实现端到端自主研发。他列举了SWE-Bench、CORE-Bench、MLE-Bench等基准的快速进展,以及AI在代码编写、kernel优化、模型微调、对齐研究等核心环节的能力提升,并指出OpenAI、Anthropic、DeepMind及多家创业公司已将自动化AI研发作为目标。
Google DeepMind 在 Science 发表 AI co-clinician 研究,提出三方照护框架,由医生监督下的 AI 代理辅助患者。在 98 个初级保健查询中系统仅 1 例出现关键错误,并在 OpenFDA RxQA 开放问答中超越前沿模型。
推荐理由:双盲评估与随机模拟实验为医疗AI协作提供了可复现的验证框架,读者可借此理解多模态能力边界与安全架构的设计取舍。
Google 发布 ERA 辅助科研的预印本,展示其在流行病学、宇宙学、气候与神经科学四个领域的应用。在流感、COVID-19 和 RSV 预测中,ERA 达到或接近 CDC 顶级预测水平;与 Gemini Deep Think 结合推导出宇宙弦引力辐射的统一公式;利用 GOES East 卫星数据以 10 分钟间隔反演柱平均 CO2;在斑马鱼神经回路中发现可泛化的机制性解。
推荐理由:四类科学场景展示了 ERA 与 LLM 协作解决开放问题的潜力,为 AI 辅助科研提供可迁移方法。
NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。
推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。
Mistral AI 发布 Workflows 进入公开预览,这是面向企业 AI 的编排层,基于 Temporal 引擎提供容错执行、可观测性与人工审批。开发者用 Python 编写工作流,通过 Le Chat 触发,Studio 记录全量执行轨迹;控制平面在 Mistral,Worker 部署在用户自有 Kubernetes 环境,支持云、本地或混合部署。
Ethan Mollick 以早期访问者身份评测 GPT-5.5,认为它是重要进展但前沿能力仍不均衡。他用同一编程挑战对比 o3、Kimi K2.6 与 GPT-5.5 Pro,展示 GPT-5.5 Pro 在建模能力和速度上的提升(33 分钟降至 20 分钟),并结合 Codex、Otter Test 与学术论文生成等案例说明模型、应用与工具链的组合效应。
Vector 团队在 ICLR 2026 发表 48 篇论文并主导 6 个研讨会,覆盖强化推理、生成式多模态、自主智能体、可信 AI 与科学发现等方向。
Google Research提出ReasoningBank框架,使智能体能从成功与失败经验中蒸馏推理模式并实现测试时自我进化。在WebArena和SWE-Bench-Verified上,基于Gemini-2.5-Flash的ReasoningBank相比无记忆基线分别提升8.3%和4.6%成功率。MaTTS通过并行与串行缩放进一步增强学习效果。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助各行业大规模采用前沿 AI。
Berkeley 团队提出 GRASP,一种针对学习型世界模型的长时序梯度规划器。它通过提升轨迹到虚拟状态实现时间并行优化,在状态迭代中注入噪声探索,并重塑梯度以保留动作梯度、截断易受对抗攻击的状态输入梯度。在 Push-T 任务上,GRASP 在更长时间范围下取得了比 CEM、GD、LatCo 更高的成功率和更快的收敛速度。相关论文已发布于 arXiv。
推荐理由:GRASP 用梯度松弛与状态噪声探索解决长时序世界模型规划的病态优化问题,为当前大模型规划器提供了一条可复用的优化路径。
Sayash Kapoor 等人提出开放世界评估概念并介绍 CRUX 项目,首轮实验让 AI 代理在 macOS 虚拟机上开发并发布 iOS 应用,仅需一次不必要的人工干预,耗时约 45 分钟开发、10 天审核,总成本约 1000 美元,其中开发与提交仅 25 美元。作者据此提示应用商店可能面临代理自动提交 spam 的早期风险,并建议明确人工干预边界、公开日志、进行干跑与实时监控。
推荐理由:文章通过 CRUX 首轮实验揭示代理已接近自主发布应用,对应用商店治理与能力评估范式转移具有参考价值。
Google Research 提出 Simula 框架,将合成数据生成重构为机制设计问题,通过推理驱动实现可控制的数据集构建。论文发表于 Transactions on Machine Learning Research,在网络安全、法律推理、数学等五个领域最多生成 512K 数据点,全系统一致优于简单基线,且高质量数据比单纯增加数量更有效。