Skip to content

#MCP/工具调用

7 today
TodayOct 7Wed
  1. arXiv · Machine Learning Theory29

    SchemaFill:用槽位并行投机解码提升 LLM 工具调用效率

    SchemaFill 提出槽位并行投机解码框架,让 LLM 工具调用中的未来槽位值并发生成候选,再由目标模型在实际输出前缀下验证,仅提交通过验证的 token。候选可跨多个字段和调用拼接验证,无需预知实际调用序列或参数值。在 Glaive 和 BFCL 上,端到端吞吐量较自回归解码最高提升 4.05×,代码已开源。

  2. arXiv · Artificial Intelligence28

    TopoPlanner:面向 LLM 智能体的胞腔工作流复合体拓扑一致任务规划

    TopoPlanner 提出拓扑一致规划框架,将工具依赖图提升为胞腔工作流复合体,作为 LLM 工具规划的拓扑感知上下文。它通过余层一致胞腔检索获取请求相关闭子复合体,在检索拓扑上做多维结构推理,并接入规划 LLM 生成工具序列。在四个工具规划基准的 loop、merge 与 loop-merge 工作流上,TopoPlanner 在不同本地 LLM 骨干上均优于 prompt 与图增强基线。

  3. arXiv · Computation and Language43

    Redpine Science 四象限评测:检索与回答质量对比

    Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一接入,本报告用四个评测衡量其检索与回答质量。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的声明,无检索基线为 87.6%;在专家验证题集上为 80.1%,仅用网页搜索的智能体为 70.2%。

  4. arXiv · Computation and Language53

    SafeActBench:工具调用智能体如何从证据走向行动并失败

    论文提出 SafeActBench,包含 656 个案例、六个操作领域和五种协议,用于分析工具调用智能体在证据到行动链条中的失败。研究覆盖十种模型与 harness 配置,发现静态动作评估较强而交互执行较弱,失败常发生在执行前的调查不完整或证据未建立阶段;单动作执行通常可靠,多动作流程还会暴露前置条件未解决和执行不完整。

  5. arXiv · Computation and Language36

    Turnslide:用有限状态机行走实现可扩展多轮数据合成

    Turnslide 提出一个全自动轻量级多轮数据合成框架,将每个 API 建模为有限状态机,生成状态合法的工具序列,并用单次 LLM 调用把序列转成完整样本。该方法不追求多样性,而是对轮数、工具序列和任务复杂度设定目标分布。在下游 SLM 微调中,其 FSM 生成数据显著优于未变异基线,达到 70.7% 全准确率(对比 63.4% 和 53.7%),且 token 用量减少 3.6-6.6 倍。

Oct 6Tue
  1. AWS Machine Learning Blog36

    用 Amazon Bedrock AgentCore 评估多智能体系统的可解释性与有用性

    Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,用于衡量多智能体系统的准确性、任务成功率与行为质量。内置评估器覆盖 helpfulness、task success、instruction following 等通用维度,自定义评估器可检查约束满足、路径可行性、SQL 正确性、库存 grounding 与解释质量。

Oct 5Mon
Oct 2Fri
  1. arXiv · Software Engineering31

    MCP Agent 框架的线后语义变化定位方法

    论文提出一种差分测试方法,将固定工具结果追踪至各框架公开接口并校验消费者需求。在 18 个设计夹具、4 个 pinned Python 集成中识别出 13 个独特夹具任务分歧,涉及结构化值、声明错误和富内容。Google ADK 满足其观测路径上的全部主契约,其余集成出现接口特定变化或执行失败;研究提供可复现的接口级证据,而非生产故障率或模型行为测量。

Oct 1Thu
Sep 30Wed
Sep 28Mon
Sep 25Fri
Sep 17Thu
  1. Microsoft Semantic Kernel62

    从专家代理到基于 MCP 的分布式技能:教程与实测对比

    作者 Tommaso Stocchi 以滑雪度假村演示为例,对比 A2A 专家代理与基于 MCP 的分布式技能两种架构,并给出五步迁移流程。技能路径将专家指令移入编排器,由 SDK 直接加载 SKILL.md 并暴露 MCP 工具;实测显示技能路径模型调用更少(3 次 vs 6-7 次)、延迟更低,但总 token 数反而增加约 22%。

    Why it matters: 通过同一应用的 A2A 与 MCP 两种架构对比,给出可迁移的迁移步骤与实测延迟和 token 数据,帮助读者判断是否将专家代理改为分布式技能。

Sep 4Fri
  1. LangChain · Official76

    LangChain 升级 MCP 支持:无状态协议、中断与客户端缓存

    LangChain 将 MCP 支持移入主包 langchain.mcp,基于 FastMCP 并兼容新旧协议。新增无状态核心、客户端缓存与通过 LangGraph 中断实现的 elicitation 支持。安装命令为 pip install "langchain[mcp]",要求 langchain[mcp]>=1.4.0,Python 版已发布,TypeScript 版即将推出。

    Why it matters: 无状态协议降低了部署复杂度,中断与缓存机制可直接迁移到现有 Agent 工作流。

Aug 26Wed
Aug 21Fri
Aug 11Tue
  1. Cloudflare · AI77

    Cloudflare Agents Week 发布汇总

    Cloudflare 在 Agents Week 期间推出 Workers 计算机运行时、Agent 开发生命周期(ADLC)、Cloudflare Agents、Wallets、Agent Access Model、WebMCP、MCPv2、Kitesurf 浏览器、AI Search 及统一 AI 控制平面等工具与平台更新。

    Why it matters: Cloudflare 把 Agent 全生命周期接入平台,读者可据此评估自研 Agent 工作流与基础设施选型。

Aug 5Wed
  1. Microsoft Semantic Kernel72

    GitHub Copilot Agent 在 Microsoft Agent Framework 中正式发布

    GitHub Copilot Agent 在 Microsoft Agent Framework 中正式发布,支持 .NET 和 Python。Copilot 负责模型调用、工具执行、规划与会话状态,Agent Framework 提供指令、流式传输、中间件、可观测性与人工审批。

    Why it matters: GitHub Copilot 的编码能力与 Agent Framework 的扩展性结合,开发者可在同一编程模型里接入 MCP、自定义工具和审批治理。

Jul 28Tue
  1. Microsoft Semantic Kernel62

    .NET Agent 支持从 MCP 服务器发现和加载 Agent Skills

    Microsoft Semantic Kernel 在 .NET 中通过 Microsoft.Agents.AI.Mcp 包支持从 MCP 服务器按需发现和加载 Agent Skills。技能以 skill-md 或 archive 方式分发,通过 skill://index.json 发现,并保留渐进式披露和审批机制。archive 下载有文件数、大小和解压后大小上限,且远程脚本永不执行。

    Why it matters: 让 Agent 按需从 MCP 服务器发现和加载技能,减少重复打包与重新部署,适合多 Agent 共享领域知识。

Jun 25Thu
  1. Google DeepMind60

    Gemini 3.5 Flash 新增计算机使用功能,支持构建跨平台智能体

    Gemini 3.5 Flash 内置计算机使用能力,开发者可通过 Gemini API 和企业平台构建跨浏览器、移动端与桌面的自定义智能体。该功能此前仅作为独立的 Gemini 2.5 计算机使用模型提供,现原生集成至 Flash 模型,并配备提示注入对抗训练及可选的企业安全防护系统。

    Why it matters: 计算机使用功能从独立模型整合进3.5 Flash,开发者可通过API和企业平台构建跨浏览器、移动端与桌面的自定义智能体,并配备提示注入防护与企业级安全机制。

Jun 24Wed
May 22Fri
  1. Mistral AI64

    Mistral Studio 发布 Connectors 支持内置与自定义 MCP

    Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。

    Why it matters: Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。

Apr 17Fri
Mar 17Tue
Sep 2Tue
May 27Tue
  1. Mistral AI62

    Mistral 发布 Agents API

    Mistral 发布 Agents API,将语言模型与代码执行、网页搜索、图像生成及 MCP 工具等内置连接器结合,并提供持久记忆与多智能体编排能力。SimpleQA 上 Mistral Large 和 Medium 启用网页搜索后得分分别从 23%、22.08% 提升至 75%、82.32%。

    Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。