跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 41–60 条 · 共 139 条
9月17日周四
  1. Nature · Machine Learning62

    AI 衰老研究新工具:专用大语言模型与 17 项基准发布

    Cell 今日发表报告,公布一套面向衰老生物学的人工智能系统,包含基于衰老数据训练的 LLM、17 项基准任务,以及将模型与代理(agent)整合的接口。作者用这些基准评估了专用 LLM 和 OpenAI、DeepSeek 等公司的通用大模型,发现专用模型在多数测试中表现更优。研究指出,衰老尚未有清晰定义,如何训练 AI 理解衰老仍是关键难题。

    推荐理由:为衰老生物学专门定制 LLM 与 17 项基准,揭示专用模型在特定领域或优于通用大模型。

  2. Microsoft Semantic Kernel62

    从专家代理到基于 MCP 的分布式技能:教程与实测对比

    作者 Tommaso Stocchi 以滑雪度假村演示为例,对比 A2A 专家代理与基于 MCP 的分布式技能两种架构,并给出五步迁移流程。技能路径将专家指令移入编排器,由 SDK 直接加载 SKILL.md 并暴露 MCP 工具;实测显示技能路径模型调用更少(3 次 vs 6-7 次)、延迟更低,但总 token 数反而增加约 22%。

    推荐理由:通过同一应用的 A2A 与 MCP 两种架构对比,给出可迁移的迁移步骤与实测延迟和 token 数据,帮助读者判断是否将专家代理改为分布式技能。

9月16日周三
  1. Latent Space88

    TypeSafe 发布 Jev:专注决策而非文本生成的前沿模型

    TypeSafe 发布 Jev,基于 RLCD 训练,宣称比小型前沿 LLM 快 20–200 倍、便宜 40–400 倍,输出 token 免费。社区指出它并非通用语言模型,更接近结构化分类器或裁判模型,适合替代生产系统中的 LLM 路由与判断。

    推荐理由:原文给出 Jev 在延迟与成本上的具体倍数优势,读者可据此判断其是否值得替代现有分类器与路由策略。

  2. Nature · Machine Learning74

    Paper2Agent:将科研论文转化为交互式 AI 智能体

    Nature 报道了 Miao 等人提出的 Paper2Agent 框架,可自动将科研论文转化为具备问答、方法应用与协作能力的 AI 智能体,提升研究的可复现性与可复用性。

    推荐理由:将静态论文转化为可交互的智能体,为研究复用与可复现性提供了新的技术路径。

  3. Apple Machine Learning Research73

    Shared Selective Persistent Memory for Agentic LLM Systems

    Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。

    推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。

  4. Google Research62

    Retrieve-for-Train:绕过推理瓶颈,加速复杂AI搜索

    Google Research提出Retrieve-for-Train框架,用离线强化学习发现属性对齐的查询扩展并编译为监督信号,再蒸馏到53.9M参数的扩散检索器,实现单次非自回归查询扇出。实验显示该方法在开放抽象检索和弱监督组合检索上均优于单查询搜索、零样本扩展和Best-of-N基线,同时实现12–20倍的推理加速。

    推荐理由:用离线RL把查询分解编译成监督信号,再注入轻量扩散检索器,在保持集合级属性的同时把推理延迟压低一到两个数量级。

  5. Hugging Face Blog74

    ALTK-Evolve 一致性指南:智能体任务通过率平均与全通过间的差距及诊断修复方法

    Hugging Face 博客介绍 ALTK-Evolve 的一致性指南与一致性分析器:在 AppWorld 上,GPT-4.1 的 ReAct 智能体 Mean@5 为 77.4%,但 Pass^5 仅 53.0%,一致性缺口 24.4 点。

    推荐理由:原文给出了可复现的诊断方法与量化结果,读者可据此评估自身智能体在重复任务中的可靠性缺口。

9月14日周一
  1. MIT News · AI62

    MIT提出HardFlow方法使生成AI适用于安全关键场景

    MIT研究人员提出HardFlow算法,通过在生成过程末端而非中间步骤强制硬约束,使扩散模型和流匹配模型在机器人路径规划等安全关键场景中既满足严格约束又提升解质量。实验表明HardFlow在机器人操作、迷宫导航和文本引导图像编辑中实现完美约束满足,并在解质量上持续超越基线,计算时间与多数方法相当或更低。

    推荐理由:该方法在部署时即可对预训练生成模型施加硬约束而不重新训练,为机器人等安全关键场景提供了可即插即用的改进路径。

9月12日周六
  1. GitHub Blog · AI & ML67

    Marketing ops as code:用 GitHub Copilot 自动化从策划到跟进的活动流程

    作者 Tomoko Tanaka 介绍如何将 GitHub Issues、Issue forms、Labels、GitHub Actions 与 Copilot agent skills 组合,把活动落地页生成、UTM 链接、邀请邮件、注册名单清洗、CRM 上传和报告等重复流程自动化。

    推荐理由:作者以第一手经验展示如何用 GitHub Copilot 将重复营销流程自动化,读者可迁移该方法到自身有 API/CLI 入口的重复任务。

9月11日周五
9月10日周四
  1. Hugging Face Blog63

    HF Jobs 上用 LoRA 实现异步 GRPO 训练:一个存储桶、一个代理、无需 NCCL

    TRL v1.14 的 AsyncGRPOTrainer 新增 LoRA 适配器仅同步功能,结合 HF Jobs Storage Bucket 挂载,使训练与推理可运行在独立机器上,无需 NCCL。五次实验将 500 步训练从 3h27m 优化至 53min,通过 token 预算批处理和提升并发请求数将瓶颈从训练端转移到生成端。

    推荐理由:通过LoRA适配器仅同步加存储桶挂载,训练与推理可部署在独立HF Jobs上无需NCCL,五次实验将500步训练从3小时27分压缩至53分钟。

9月9日周三
  1. Mistral AI68

    Mistral 用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++

    Mistral 帮助欧洲能源运营商将 40,000 行 Fortran 77 迁移到 C++,并给出结构化智能体工作流:先构建数值 parity harness,再整理文档,最后由人类审核员驱动 coder、tester、reviewer 智能体逐模块迁移。

    推荐理由:原文给出了一套可迁移的现代化工作流,读者可以据此评估自身代码迁移中自动化与人工审查的平衡点。

  2. Together AI64

    开源 AI 栈:模型、推理、网关与 Harness 的选型与组合指南

    Together AI 发布开源 AI 栈指南,将栈分为模型、推理、网关与路由器、Harness、工具与上下文管理五层。推荐同时使用大模型(如 Kimi K3,1.8T 总参数)与小模型(如 GLM 5.3 Flash,320B 总参数)处理不同复杂度的任务,并可通过 OpenRouter、Vercel AI Gateway 或 LiteLLM 路由多提供商。

    推荐理由:原文分层拆解开源 AI 栈各层组件与选型思路,开发者可按需组合模型、网关与工具。

9月5日周六
  1. GitHub Blog · AI & ML60

    GitHub Copilot Project HydraFusion:通过多模型编排实现前沿质量

    GitHub Copilot 发布 Project HydraFusion 研究预览,通过运行时多模型编排自动选择工作流以平衡性能、成本和延迟。在 TerminalBench 2.1 上比 Claude Opus 5 质量提升 4.9 个百分点且成本降低 67%,DeepSWE 和 CheckpointBench 上也接近 Opus 5 水平。

    推荐理由:HydraFusion通过多模型编排自动选择最优工作流,在三个编码基准中以显著成本降低逼近Claude Opus 5的性能,为开发者提供无需手动协调模型的前沿质量编码体验。

9月3日周四
  1. Hugging Face Blog67

    用 TRL 和 OpenEnv 训练代码生成水彩画模型

    作者用 TRL + OpenEnv 复现 Surya Narreddi 的水彩画训练流水线,全部工件开源并在 Hugging Face 上端到端运行。奖励函数由编译门、代码长度、Qwen3-VL 配对裁判和 HPSv3 美学偏好组成,三组奖励混合(judge-led / hps-led / hps-only)对比显示,裁判权重越高起始奖励越低但最终质量提升越明显。

    推荐理由:原文给出了完整开源流水线和三次奖励对比,读者可据此复现并迁移到其他审美偏好数据集。

  2. GitHub Engineering69

    GitHub Copilot 四项优化降低 AI 编码成本且不牺牲任务质量

    GitHub Engineering 公布 GitHub Copilot 的四项成本优化:选择性压缩重复输出、移除文件读取行号前缀、缩短任务工具提示词、批量送达后台完成结果。离线基准与在线实验显示平均成本下降约 2.3%–5%,无质量回归;强调应按完整任务而非单次工具调用评估效率。

    推荐理由:GitHub Copilot 通过四项工程优化降低 AI 编码成本,读者可据此理解上下文压缩与提示精简的边界。

  3. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。

    推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。

9月2日周三
  1. Meta Engineering · AI80

    Meta 构建组织第二大脑:AI 从专家处学习并持续改进

    Meta 发布一个组织级 AI Agent,通过结构化知识库与可组合食谱分离知识与推理,并借助自改进循环将专家反馈编译为经过回归测试的更新,无需模型重训练。系统包含知识层、推理层、评估框架与改进循环,经过六周三轮开发实现评估时间从天降至分钟、零回归,且每次修正自动强化回归套件。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。