跳到正文

#Agent

今日 70 条
6月22日周一
  1. Interconnects82

    GLM-5.2 是开放智能体的关键一步

    Nathan Lambert 亲测 GLM-5.2 后认为,它是首个在编码 harness 中表现可靠的开放权重通用智能体模型,Arena 评测中已能比肩 Claude Opus 4.8 的 max 模式。社区反响强烈,作者将其与 DeepSeek R1 类比,并指出这会给 Anthropic 带来定价压力,同时让开放模型经济迎来拐点。

    推荐理由:作者以亲测视角说明 GLM-5.2 在编码智能体工作流中的可用性,为读者判断开放模型何时能替代闭源前沿模型提供可迁移观察。

  2. Import AI74

    Import AI 462:Superpersuasion;自持AI;通往ASI之路

    Import AI 第462期汇总多项AI研究与讨论:牛津、斯坦福等机构实证AI在政策劝说和慈善募捐中可超越专家人类,且AI速度优势是劝说力的关键来源;Ajeya Cotra与Timothy B. Lee讨论自持AI时间表与具身机器人瓶颈;DeepMind论文探讨从AGI到ASI的路径与递归自我改进;Recursive展示自动化AI研究系统在训练与GPU内核优化上的新结果。

6月10日周三
  1. Google DeepMind44

    Google DeepMind 联合 Schmidt Sciences 等机构投资多智能体 AI 安全研究

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的技术研究资助,面向全球研究人员。资助重点研究大规模多智能体 AI 系统的群体行为,并提供框架以理解和缓解潜在风险。申请截止日期为 2026 年 8 月 8 日,获奖者预计于 2026 年秋季公布。

6月9日周二
  1. Amazon Science47

    Project Eluna:智能体 AI 的物理世界锚定

    2026 年 AI 从"知道"转向"行动",Amazon 推出 Project Eluna,作为仓库运营的智能体模型,通过数字仪表板辅助运营决策。论文提出四种锚定方法:物理引导深度学习、不确定性感知推理、文本到数值桥接,以及第四种方法。UQ4CT 框架在五个基准上保持高准确率,同时将预期校准误差降低 25% 以上。

  2. Amazon Science77

    亚马逊研究提出意图执行差距框架并开源 Simple Strands Agent

    亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。

    推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。

6月8日周一
  1. Google DeepMind67

    DeepMind 发布 AI 辅助学习在塞拉利昂的 RCT 结果

    DeepMind 发布塞拉利昂预注册 RCT 结果,使用 Guided Learning 的学生数学成绩提升 +0.258 标准差,相当于 1.2-1.7 年学习进度;教师将 Gemini 融入约一半课堂的小组增益达 1.8-2.5 年。

    推荐理由:在塞拉利昂的 RCT 显示 AI 辅导可带来 1.2-2.5 年学习进度增益,为教育 AI 的实证基础提供了关键数据。

6月6日周六
  1. Sebastian Raschka16

    LLM 研究论文清单:2026 年 1 月至 5 月

    summary_zh: Sebastian Raschka 整理了 2026 年 1 月至 5 月他标记的 LLM 研究论文清单,涵盖架构与模型设计、高效训练与推理、稀疏注意力与长上下文、推理与测试时计算、强化学习、智能体系统、编码智能体、扩散语言模型及评测基准等类别。

6月5日周五
  1. ScienceDaily · AI33

    科学家严肃探讨蜜蜂与 ChatGPT 是否具有意识

    两篇新论文分别从 AI 机制和昆虫神经计算角度提出意识测试指标,而非仅依赖表面行为。ChatGPT 等现有大语言模型的行为表现不构成意识归因的依据,但未来不同架构的 AI 仍可能具备意识。研究者指出,判断意识应关注信息处理方式而非行为表现,人类、昆虫与机器在比较框架上趋于统一。

6月3日周三
  1. Amazon Science73

    Ground truth is a process, not a dataset

    Amazon AGI 团队提出 audit-then-score 协议与 DeepFact-Bench、DeepFact-Eval 两套数据集,用于评估 AI 生成的研究报告。实验显示,未经辅助的专家在已知答案集上仅 60.8% 准确率,而经过四轮审核校准后升至 90.9%;DeepFact-Eval 基于 GPT-4.1 达 83.4%,优于传统事实核查系统与既有深度研究系统。

    推荐理由:原文揭示了深度研究场景下静态基准的局限,为理解 AI 评估体系的演进方向提供了可迁移方法。

5月29日周五
5月28日周四
5月27日周三
  1. Mistral AI42

    Mistral 发布 physics AI:工程加速的基础

    Mistral 发布 physics AI,将工程仿真从数小时/周缩短到秒级单 GPU 前向传播。整合 Emmi AI 作为企业解决方案中新基础能力,合作伙伴包括 ASML、Airbus、Safran 和 Siemens Energy。覆盖产品设计、工装工艺设计和实时数字孪生三大场景,不是替代传统求解器,而是大幅提升设计迭代吞吐量。

5月22日周五
  1. Mistral AI64

    Mistral Studio 发布 Connectors 支持内置与自定义 MCP

    Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。

    推荐理由:Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。

5月20日周三
  1. Google Research58

    ERA发表Nature论文并推动计算发现

    Google在Nature发表ERA论文并将其作为工具开放,ERA使用Gemini通过树搜索优化科学代码,在基因组学、公共卫生等六类基准上达到专家级性能。ERA已应用于八个科学问题的研究中,涵盖流行病预测、CO2监测、径流预报、太阳能优化和零售预测,并作为Computational Discovery的核心组件通过Gemini for Science逐步开放。

5月19日周二
5月17日周日
5月16日周六
  1. Google DeepMind64

    Co-Scientist 辅助发现可对抗肝纤维化的已上市药物

    斯坦福遗传学家 Gary Peltz 使用 Co-Scientist 从现有药物文献中筛选肝纤维化候选药,Co-Scientist 提出的三种候选药中有两种在人体肝细胞实验中阻断纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的损伤应答。

    推荐理由:原文给出 Co-Scientist 在肝纤维化药物筛选中的对比结果,读者可据此评估 AI 科研助手在真实实验中的辅助价值。

  2. Google DeepMind83

    Gemini 3.5 Flash 发布:前沿智能与智能体能力

    Google DeepMind 发布 Gemini 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上表现领先,输出速度比其他前沿模型快 4 倍。

    推荐理由:原文给出 Flash 在多个基准上的具体分数与速度倍数,读者可据此对比其与上一代 Pro 的能力变化。

5月12日周二
  1. Google DeepMind77

    Co-Scientist:加速科研的多智能体 AI 合作伙伴

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论与演化假设来加速生命科学等领域的科研突破。

    推荐理由:原文给出多智能体协作与假设生成引擎的具体阶段,读者可据此评估它对现有科研工作流的实际改变。

5月6日周三
  1. Google DeepMind82

    AlphaEvolve:Gemini 驱动的编程智能体跨领域规模化影响

    Google DeepMind 发布 AlphaEvolve,一款由 Gemini 驱动的编程智能体,用于设计高级算法并已在数学、计算机科学和 Google 基础设施中部署。

    推荐理由:原文展示了 AlphaEvolve 在数学、量子物理、基础设施和商业场景中的具体提升,读者可据此评估它作为通用算法设计智能体的实际边界。

  2. ScienceDaily · AI56

    EPFL 团队推出 Synthegy:化学家通过自然语言描述设计分子

    EPFL Philippe Schwaller 团队在 Matter 发表 Synthegy 框架,将大语言模型作为推理工具指导传统计算搜索。化学家以自然语言给出合成策略(如优先成环、避免保护基),系统评分并解释匹配度,双盲研究中 36 位化学家的评估与系统结果一致率为 71.2%。同一接口也可用于反应机理的电子步骤搜索与条件细化。

5月4日周一
  1. Import AI59

    Import AI 455:AI系统即将开始自主构建自身

    Jack Clark在Import AI 455中基于公开基准的聚合趋势,认为AI系统有60%以上概率在2028年底前实现端到端自主研发。他列举了SWE-Bench、CORE-Bench、MLE-Bench等基准的快速进展,以及AI在代码编写、kernel优化、模型微调、对齐研究等核心环节的能力提升,并指出OpenAI、Anthropic、DeepMind及多家创业公司已将自动化AI研发作为目标。

4月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 AI co-clinician 研究倡议

    Google DeepMind 在 Science 发表 AI co-clinician 研究,提出三方照护框架,由医生监督下的 AI 代理辅助患者。在 98 个初级保健查询中系统仅 1 例出现关键错误,并在 OpenFDA RxQA 开放问答中超越前沿模型。

    推荐理由:双盲评估与随机模拟实验为医疗AI协作提供了可复现的验证框架,读者可借此理解多模态能力边界与安全架构的设计取舍。

  2. Google Research67

    Google Research 科学家使用 Empirical Research Assistance 的四种方式

    Google 发布 ERA 辅助科研的预印本,展示其在流行病学、宇宙学、气候与神经科学四个领域的应用。在流感、COVID-19 和 RSV 预测中,ERA 达到或接近 CDC 顶级预测水平;与 Gemini Deep Think 结合推导出宇宙弦引力辐射的统一公式;利用 GOES East 卫星数据以 10 分钟间隔反演柱平均 CO2;在斑马鱼神经回路中发现可泛化的机制性解。

    推荐理由:四类科学场景展示了 ERA 与 LLM 协作解决开放问题的潜力,为 AI 辅助科研提供可迁移方法。

4月28日周二
  1. Together AI60

    Together AI 在 Day 0 推出 NVIDIA Nemotron 3 Nano Omni

    NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。

    推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。

4月27日周一
4月22日周三
  1. Google Research59

    ReasoningBank:赋能智能体从经验中学习

    Google Research提出ReasoningBank框架,使智能体能从成功与失败经验中蒸馏推理模式并实现测试时自我进化。在WebArena和SWE-Bench-Verified上,基于Gemini-2.5-Flash的ReasoningBank相比无记忆基线分别提升8.3%和4.6%成功率。MaTTS通过并行与串行缩放进一步增强学习效果。

4月21日周二
4月20日周一
  1. Berkeley AI Research62

    GRASP:基于梯度的长时序世界模型规划方法

    Berkeley 团队提出 GRASP,一种针对学习型世界模型的长时序梯度规划器。它通过提升轨迹到虚拟状态实现时间并行优化,在状态迭代中注入噪声探索,并重塑梯度以保留动作梯度、截断易受对抗攻击的状态输入梯度。在 Push-T 任务上,GRASP 在更长时间范围下取得了比 CEM、GD、LatCo 更高的成功率和更快的收敛速度。相关论文已发布于 arXiv。

    推荐理由:GRASP 用梯度松弛与状态噪声探索解决长时序世界模型规划的病态优化问题,为当前大模型规划器提供了一条可复用的优化路径。

4月16日周四
  1. Google Research56

    设计真实世界的合成数据集:机制设计与从第一原理推理

    Google Research 提出 Simula 框架,将合成数据生成重构为机制设计问题,通过推理驱动实现可控制的数据集构建。论文发表于 Transactions on Machine Learning Research,在网络安全、法律推理、数学等五个领域最多生成 512K 数据点,全系统一致优于简单基线,且高质量数据比单纯增加数量更有效。