SchemaFill:用槽位并行投机解码提升 LLM 工具调用效率
SchemaFill 提出槽位并行投机解码框架,让 LLM 工具调用中的未来槽位值并发生成候选,再由目标模型在实际输出前缀下验证,仅提交通过验证的 token。候选可跨多个字段和调用拼接验证,无需预知实际调用序列或参数值。在 Glaive 和 BFCL 上,端到端吞吐量较自回归解码最高提升 4.05×,代码已开源。
SchemaFill 提出槽位并行投机解码框架,让 LLM 工具调用中的未来槽位值并发生成候选,再由目标模型在实际输出前缀下验证,仅提交通过验证的 token。候选可跨多个字段和调用拼接验证,无需预知实际调用序列或参数值。在 Glaive 和 BFCL 上,端到端吞吐量较自回归解码最高提升 4.05×,代码已开源。
TopoPlanner 提出拓扑一致规划框架,将工具依赖图提升为胞腔工作流复合体,作为 LLM 工具规划的拓扑感知上下文。它通过余层一致胞腔检索获取请求相关闭子复合体,在检索拓扑上做多维结构推理,并接入规划 LLM 生成工具序列。在四个工具规划基准的 loop、merge 与 loop-merge 工作流上,TopoPlanner 在不同本地 LLM 骨干上均优于 prompt 与图增强基线。
论文提出 TACIT 框架,将外部能力需求沿 Source、Transformation、World Effect 三个轴分解为八类结构能力。研究用 1,600 条均衡训练查询,对四个开源 LLM 家族的生成前隐藏状态训练线性探针,发现细粒度能力结构可被高准确率线性解码。
Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一接入,本报告用四个评测衡量其检索与回答质量。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的声明,无检索基线为 87.6%;在专家验证题集上为 80.1%,仅用网页搜索的智能体为 70.2%。
研究提出通过 MCP 逐步下发流程:服务器每次释放一个步骤,智能体执行后返回结构化 step_output,使执行路径在运行前即被规定,并生成可审计的机器可读执行日志。
论文提出 SafeActBench,包含 656 个案例、六个操作领域和五种协议,用于分析工具调用智能体在证据到行动链条中的失败。研究覆盖十种模型与 harness 配置,发现静态动作评估较强而交互执行较弱,失败常发生在执行前的调查不完整或证据未建立阶段;单动作执行通常可靠,多动作流程还会暴露前置条件未解决和执行不完整。
Turnslide 提出一个全自动轻量级多轮数据合成框架,将每个 API 建模为有限状态机,生成状态合法的工具序列,并用单次 LLM 调用把序列转成完整样本。该方法不追求多样性,而是对轮数、工具序列和任务复杂度设定目标分布。在下游 SLM 微调中,其 FSM 生成数据显著优于未变异基线,达到 70.7% 全准确率(对比 63.4% 和 53.7%),且 token 用量减少 3.6-6.6 倍。
AWS 展示如何在航空应用中构建语音旅行客服,用 Amazon Nova 2.5 Sonic 实时语音模型、Strands Agents 框架与 Amazon Bedrock AgentCore runtime 托管智能体。
Meta 的 ads MCP server 现已上线 Databricks Marketplace,可接入 Genie,让营销人员用自然语言把流失分、LTV、毛利表等受治理数据与 Meta 广告投放表现放在同一会话中分析。
Anthropic 的 Claude Opus 5.5 与 Claude Sonnet 5.5 在 AWS GovCloud (US) 上线,为 ITAR 等受监管工作负载提供 AI 辅助开发入口。
Amazon SageMaker AI optimized generative AI inference 推出 aws-ai-ml skill,通过 Agent Toolkit for AWS 提供,支持 Kiro、Claude Code、Codex 及任何兼容 MCP 的编码智能体。
Databricks 阐述 Genie Ontology 如何为 Genie 补充企业上下文:先基于 Unity Catalog 中经治理与认证的核心概念,再从仪表板、文档、查询、notebook 和连接应用学习知识,并由 OntoRank 按认证、使用与作者身份排序权威性。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,用于衡量多智能体系统的准确性、任务成功率与行为质量。内置评估器覆盖 helpfulness、task success、instruction following 等通用维度,自定义评估器可检查约束满足、路径可行性、SQL 正确性、库存 grounding 与解释质量。
Amazon Quick 现可通过托管在 Amazon Bedrock AgentCore 上的 MCP 示例服务器 Quick Resource Migrator,将 chat agents、action connectors、knowledge bases、flows 和 spaces 从开发账户自动迁移到生产账户。
Cloudflare 在 Birthday Week 2026 共发布 46 项公告,围绕开源、应用安全、智能体经济和开发者平台展开。
论文提出 Comparative Inference for Tool-use Agents(CITA),训练比较推理模型(CIM)在执行前估计下一次工具调用对最终任务成功的长期价值。
论文提出一种差分测试方法,将固定工具结果追踪至各框架公开接口并校验消费者需求。在 18 个设计夹具、4 个 pinned Python 集成中识别出 13 个独特夹具任务分歧,涉及结构化值、声明错误和富内容。Google ADK 满足其观测路径上的全部主契约,其余集成出现接口特定变化或执行失败;研究提供可复现的接口级证据,而非生产故障率或模型行为测量。
summary_zh: Databricks 联合 OpenAI 与 Stellantis 探讨企业级智能体应用扩展,提出需在选择、上下文与控制三方面建设基础设施。
summary_zh: PyTorch Conference North America 2026 将于近日在圣何塞召开,Ray 作为分布式计算框架贯穿训练、部署与后训练全流程。
Google Cloud API Gateway 进入 Public Preview,可作为远程 MCP server,将已有 REST 操作直接暴露为 agent 可调用的 MCP 工具,无需单独搭建服务器。
Hcompany 发布智能体模型 Holo4,提供 27B 稠密版与 35B-A3B MoE,并推出 Holotron4 Nano。
Why it matters: 同一模型同时覆盖图形界面、代码和工具调用,便于对照它在更低成本下与闭源模型的长流程得分差距。
summary_zh: Amazon Bedrock AgentCore Gateway 与 Model Context Protocol(MCP)结合,让 AI Agent 在不复制或集中数据的前提下跨多个 AWS 账户查询。
Cooley 基于 ChatGPT Work 构建了 GO Public 工具,将智能引入 IPO 流程,帮助律师更早发现潜在问题并聚焦关键判断。
作者 Tommaso Stocchi 以滑雪度假村演示为例,对比 A2A 专家代理与基于 MCP 的分布式技能两种架构,并给出五步迁移流程。技能路径将专家指令移入编排器,由 SDK 直接加载 SKILL.md 并暴露 MCP 工具;实测显示技能路径模型调用更少(3 次 vs 6-7 次)、延迟更低,但总 token 数反而增加约 22%。
Why it matters: 通过同一应用的 A2A 与 MCP 两种架构对比,给出可迁移的迁移步骤与实测延迟和 token 数据,帮助读者判断是否将专家代理改为分布式技能。
LangChain 将 MCP 支持移入主包 langchain.mcp,基于 FastMCP 并兼容新旧协议。新增无状态核心、客户端缓存与通过 LangGraph 中断实现的 elicitation 支持。安装命令为 pip install "langchain[mcp]",要求 langchain[mcp]>=1.4.0,Python 版已发布,TypeScript 版即将推出。
Why it matters: 无状态协议降低了部署复杂度,中断与缓存机制可直接迁移到现有 Agent 工作流。
summary_zh: 现代 AI 平台已不再是单一登录后的应用,用户在中央门户打开受管数据集、启动笔记本并调用跨集群服务时,身份需跨越控制面与数据面边界。传统单点登录方案无法覆盖这种跨平台工作流,身份传递必须在每一步都得到保障。
Microsoft Agent Framework 发布 Python 通道包,支持 OpenAI Responses、Telegram、A2A 和 MCP 协议接入。
Why it matters: 原文给出了多协议接入能力和共享状态模型,开发者可据此判断是否需要将现有 Agent Framework 应用扩展到新的通道。
summary_zh: Google DeepMind 回顾十五年来从 Atari 到 EVE Online 的游戏 AI 研究,与 Fenris Creations 等游戏工作室合作开发 SIMA 多世界智能体。
Cloudflare 在 Agents Week 期间推出 Workers 计算机运行时、Agent 开发生命周期(ADLC)、Cloudflare Agents、Wallets、Agent Access Model、WebMCP、MCPv2、Kitesurf 浏览器、AI Search 及统一 AI 控制平面等工具与平台更新。
Why it matters: Cloudflare 把 Agent 全生命周期接入平台,读者可据此评估自研 Agent 工作流与基础设施选型。
GitHub Copilot Agent 在 Microsoft Agent Framework 中正式发布,支持 .NET 和 Python。Copilot 负责模型调用、工具执行、规划与会话状态,Agent Framework 提供指令、流式传输、中间件、可观测性与人工审批。
Why it matters: GitHub Copilot 的编码能力与 Agent Framework 的扩展性结合,开发者可在同一编程模型里接入 MCP、自定义工具和审批治理。
Microsoft Semantic Kernel 在 .NET 中通过 Microsoft.Agents.AI.Mcp 包支持从 MCP 服务器按需发现和加载 Agent Skills。技能以 skill-md 或 archive 方式分发,通过 skill://index.json 发现,并保留渐进式披露和审批机制。archive 下载有文件数、大小和解压后大小上限,且远程脚本永不执行。
Why it matters: 让 Agent 按需从 MCP 服务器发现和加载技能,减少重复打包与重新部署,适合多 Agent 共享领域知识。
Gemini 3.5 Flash 内置计算机使用能力,开发者可通过 Gemini API 和企业平台构建跨浏览器、移动端与桌面的自定义智能体。该功能此前仅作为独立的 Gemini 2.5 计算机使用模型提供,现原生集成至 Flash 模型,并配备提示注入对抗训练及可选的企业安全防护系统。
Why it matters: 计算机使用功能从独立模型整合进3.5 Flash,开发者可通过API和企业平台构建跨浏览器、移动端与桌面的自定义智能体,并配备提示注入防护与企业级安全机制。
Mistral 为 Connectors 新增多项管理与安全能力:按 workspace 或组织分配连接器访问权限、带 connector scope 的 API key、单个连接器绑定多账号,三项均已 GA。
Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。
Why it matters: Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。
卡内基梅隆大学研究团队在 Laude Institute 主办的 Moonshots AI 大赛中获得顶级认可。该大赛聚焦 AI 应对社会紧迫挑战,涵盖劳动力再技能化与扩大教育可及性等方向。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,在 FLTEval 基准上以 6B 参数超越多个更大开源模型。它通过 Mistral Vibe 集成、支持 MCP,提供免费 API 和 Apache 2.0 权重;pass@2 得分 26.3 仅需 $36,而 Sonnet 4.6 需 $549。
Mistral 在 Le Chat 上线 20+ 个企业级 MCP 连接器目录(beta)与 Memories 记忆功能(beta),对所有 Le Chat 用户免费开放。
Mistral 发布 Agents API,将语言模型与代码执行、网页搜索、图像生成及 MCP 工具等内置连接器结合,并提供持久记忆与多智能体编排能力。SimpleQA 上 Mistral Large 和 Medium 启用网页搜索后得分分别从 23%、22.08% 提升至 75%、82.32%。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。