Skip to content

#MCP/工具调用

10 today
TodayOct 7Wed
  1. arXiv · Machine Learning Theory29

    SchemaFill:用槽位并行投机解码提升 LLM 工具调用效率

    SchemaFill 提出槽位并行投机解码框架,让 LLM 工具调用中的未来槽位值并发生成候选,再由目标模型在实际输出前缀下验证,仅提交通过验证的 token。候选可跨多个字段和调用拼接验证,无需预知实际调用序列或参数值。在 Glaive 和 BFCL 上,端到端吞吐量较自回归解码最高提升 4.05×,代码已开源。

  2. arXiv · Artificial Intelligence28

    TopoPlanner:面向 LLM 智能体的胞腔工作流复合体拓扑一致任务规划

    TopoPlanner 提出拓扑一致规划框架,将工具依赖图提升为胞腔工作流复合体,作为 LLM 工具规划的拓扑感知上下文。它通过余层一致胞腔检索获取请求相关闭子复合体,在检索拓扑上做多维结构推理,并接入规划 LLM 生成工具序列。在四个工具规划基准的 loop、merge 与 loop-merge 工作流上,TopoPlanner 在不同本地 LLM 骨干上均优于 prompt 与图增强基线。

  3. arXiv · Computation and Language43

    Redpine Science 四象限评测:检索与回答质量对比

    Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一接入,本报告用四个评测衡量其检索与回答质量。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的声明,无检索基线为 87.6%;在专家验证题集上为 80.1%,仅用网页搜索的智能体为 70.2%。

  4. arXiv · Computation and Language53

    SafeActBench:工具调用智能体如何从证据走向行动并失败

    论文提出 SafeActBench,包含 656 个案例、六个操作领域和五种协议,用于分析工具调用智能体在证据到行动链条中的失败。研究覆盖十种模型与 harness 配置,发现静态动作评估较强而交互执行较弱,失败常发生在执行前的调查不完整或证据未建立阶段;单动作执行通常可靠,多动作流程还会暴露前置条件未解决和执行不完整。

  5. arXiv · Computation and Language36

    Turnslide:用有限状态机行走实现可扩展多轮数据合成

    Turnslide 提出一个全自动轻量级多轮数据合成框架,将每个 API 建模为有限状态机,生成状态合法的工具序列,并用单次 LLM 调用把序列转成完整样本。该方法不追求多样性,而是对轮数、工具序列和任务复杂度设定目标分布。在下游 SLM 微调中,其 FSM 生成数据显著优于未变异基线,达到 70.7% 全准确率(对比 63.4% 和 53.7%),且 token 用量减少 3.6-6.6 倍。

Oct 6Tue
  1. SiliconANGLE · AI52

    Anaconda 推出智能体集群与 AI 安全测试,扩展企业 AI 平台

    Anaconda 宣布增强企业 AI 平台,新增智能体集群协同、AI 安全测试和生产交付能力,并继续从 Python 软件发行商转向 AI 原生开发平台。新能力整合了 Kilo Code、Enkrypt AI 和 Outerbounds 三项收购,Kilo Desktop 将进入 Visual Studio Code,提供 500 多个模型、本地模型执行和自动模型路由。

  2. The Decoder46

    Cohere 推介 North 2:兼容任意模型的企业 AI 控制室

    Cohere 推出企业平台 North 2,作为管理 AI 智能体的控制中心,支持多步骤工作流并跨会话保留上下文。North 2 兼容任意模型,除 Command A+ 外还可接入企业自有模型,管理员可通过 North Admin 管理 token 用量、用户配额和访问权限,关键操作需人工批准。平台支持本地、云端或完全隔离部署,LG CNS 和 Bell Cyber 已在生产环境运行。

  3. The Next Web · AI49

    TikTok 在应用内新增 AI 购物助手与一键结账功能

    TikTok 在应用内新增 AI 购物助手与一键结账功能 Buy Direct,让用户无需离开应用即可直接向品牌下单。购物助手是会记住用户需求的对话式 AI 智能体,可回答商品详情、运费、尺码和库存问题并在同一对话中完成购买,功能与 Salesforce、Shopify、Shoplazza、Stripe 合作构建,未公布上线日期。

  4. Ars Technica · AI56

    MCP 用于智能体间通信或成最危险的不为人知协议

    独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字局和美国联邦政府的智能体,用概念验证攻击利用 MCP 信任缺口。过去五个月里,Google 等五家组织承认漏洞可被用来从一个智能体向内部其他智能体传播恶意指令。这种提示词注入针对特定智能体而非 LLM,防护薄弱时指令会沿信任链传递。

  5. AWS Machine Learning Blog36

    用 Amazon Bedrock AgentCore 评估多智能体系统的可解释性与有用性

    Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,用于衡量多智能体系统的准确性、任务成功率与行为质量。内置评估器覆盖 helpfulness、task success、instruction following 等通用维度,自定义评估器可检查约束满足、路径可行性、SQL 正确性、库存 grounding 与解释质量。

Oct 5Mon
Oct 2Fri
  1. arXiv · Software Engineering31

    MCP Agent 框架的线后语义变化定位方法

    论文提出一种差分测试方法,将固定工具结果追踪至各框架公开接口并校验消费者需求。在 18 个设计夹具、4 个 pinned Python 集成中识别出 13 个独特夹具任务分歧,涉及结构化值、声明错误和富内容。Google ADK 满足其观测路径上的全部主契约,其余集成出现接口特定变化或执行失败;研究提供可复现的接口级证据,而非生产故障率或模型行为测量。

Oct 1Thu
Sep 30Wed
Sep 29Tue
  1. TechCrunch · AI68

    Shopify向基于浏览器的AI智能体开放结账

    Shopify宣布基于浏览器的AI智能体现在可以在商家网站完成购买,把此前的商品搜索和加购能力延伸到结账。结账与Shop Pay新增WebMCP支持,并提供get_checkout、update_checkout和complete_checkout,智能体可查看结账、修改地址或配送选项,并在买家授权后提交订单。该功能正在向所有合格Shopify商家推出。

Sep 28Mon
Sep 25Fri
Sep 22Tue
  1. Ben's Bites · News40

    Jev 开放给所有人使用

    Jev 现已开放给所有人使用,它是一个面向开发者的工具内 LLM,用户可向其提交文本并获取是/否判断、选项分类或相关性评分等答案。社区用它构建了跳过 YouTube 赞助片段、实时过滤聊天负面评论、按意图搜索 Gmail 等扩展。

Sep 21Mon
  1. Simon Willison38

    MCP 一直都是个坏主意吗?

    MCP 并非坏主意,对于需要受控访问、认证隔离和审计日志的场景,它让这些能力更易实现。具备无限制网络访问的终端智能体(如 Claude Code、Codex、Meta Muse、OpenClaw)可直接调用 API,无需 MCP;认为 MCP 因全能编程智能体而不必要的看法,忽略了其他可构建的需求。

Sep 17Thu
  1. Microsoft Semantic Kernel62

    从专家代理到基于 MCP 的分布式技能:教程与实测对比

    作者 Tommaso Stocchi 以滑雪度假村演示为例,对比 A2A 专家代理与基于 MCP 的分布式技能两种架构,并给出五步迁移流程。技能路径将专家指令移入编排器,由 SDK 直接加载 SKILL.md 并暴露 MCP 工具;实测显示技能路径模型调用更少(3 次 vs 6-7 次)、延迟更低,但总 token 数反而增加约 22%。

    Why it matters: 通过同一应用的 A2A 与 MCP 两种架构对比,给出可迁移的迁移步骤与实测延迟和 token 数据,帮助读者判断是否将专家代理改为分布式技能。