Atlassian 推出 Agentic Multiplayer Protocol 与 Rovo Work
Atlassian 在 Team '26 Europe 发布 Agentic Multiplayer Protocol,让人类与 AI 智能体在共享上下文和任务中协作,并为智能体分配身份、权限与作用域。
Atlassian 在 Team '26 Europe 发布 Agentic Multiplayer Protocol,让人类与 AI 智能体在共享上下文和任务中协作,并为智能体分配身份、权限与作用域。
SchemaFill 提出槽位并行投机解码框架,让 LLM 工具调用中的未来槽位值并发生成候选,再由目标模型在实际输出前缀下验证,仅提交通过验证的 token。候选可跨多个字段和调用拼接验证,无需预知实际调用序列或参数值。在 Glaive 和 BFCL 上,端到端吞吐量较自回归解码最高提升 4.05×,代码已开源。
TopoPlanner 提出拓扑一致规划框架,将工具依赖图提升为胞腔工作流复合体,作为 LLM 工具规划的拓扑感知上下文。它通过余层一致胞腔检索获取请求相关闭子复合体,在检索拓扑上做多维结构推理,并接入规划 LLM 生成工具序列。在四个工具规划基准的 loop、merge 与 loop-merge 工作流上,TopoPlanner 在不同本地 LLM 骨干上均优于 prompt 与图增强基线。
论文提出 TACIT 框架,将外部能力需求沿 Source、Transformation、World Effect 三个轴分解为八类结构能力。研究用 1,600 条均衡训练查询,对四个开源 LLM 家族的生成前隐藏状态训练线性探针,发现细粒度能力结构可被高准确率线性解码。
Redpine Science 通过 MCP 和 API 为模型与智能体提供同行评审文献的统一接入,本报告用四个评测衡量其检索与回答质量。在 ScholarQABench SciFact 上,接入 Redpine Science 的智能体正确回答 94.4% 的声明,无检索基线为 87.6%;在专家验证题集上为 80.1%,仅用网页搜索的智能体为 70.2%。
研究提出通过 MCP 逐步下发流程:服务器每次释放一个步骤,智能体执行后返回结构化 step_output,使执行路径在运行前即被规定,并生成可审计的机器可读执行日志。
论文提出 SafeActBench,包含 656 个案例、六个操作领域和五种协议,用于分析工具调用智能体在证据到行动链条中的失败。研究覆盖十种模型与 harness 配置,发现静态动作评估较强而交互执行较弱,失败常发生在执行前的调查不完整或证据未建立阶段;单动作执行通常可靠,多动作流程还会暴露前置条件未解决和执行不完整。
Turnslide 提出一个全自动轻量级多轮数据合成框架,将每个 API 建模为有限状态机,生成状态合法的工具序列,并用单次 LLM 调用把序列转成完整样本。该方法不追求多样性,而是对轮数、工具序列和任务复杂度设定目标分布。在下游 SLM 微调中,其 FSM 生成数据显著优于未变异基线,达到 70.7% 全准确率(对比 63.4% 和 53.7%),且 token 用量减少 3.6-6.6 倍。
Sierra 与 Meta 正与 Genesys、Instinct、Rocket、Shopify、Stripe 和 Walmart 共同开发面向个人 AI 智能体的开放标准 Personal Agent Protocol,定义智能体如何与企业认证及被允许执行的操作,v0.1 规范计划本月晚些时候发布。
MasterClass 推出 AI 原生项目 MasterClass Executive,用多智能体系统按学习者参与方式规划课程,识别认知过载与动机下降并调整教学。
AWS 展示如何在航空应用中构建语音旅行客服,用 Amazon Nova 2.5 Sonic 实时语音模型、Strands Agents 框架与 Amazon Bedrock AgentCore runtime 托管智能体。
Anaconda 宣布增强企业 AI 平台,新增智能体集群协同、AI 安全测试和生产交付能力,并继续从 Python 软件发行商转向 AI 原生开发平台。新能力整合了 Kilo Code、Enkrypt AI 和 Outerbounds 三项收购,Kilo Desktop 将进入 Visual Studio Code,提供 500 多个模型、本地模型执行和自动模型路由。
Meta 的 ads MCP server 现已上线 Databricks Marketplace,可接入 Genie,让营销人员用自然语言把流失分、LTV、毛利表等受治理数据与 Meta 广告投放表现放在同一会话中分析。
Cohere 推出企业平台 North 2,作为管理 AI 智能体的控制中心,支持多步骤工作流并跨会话保留上下文。North 2 兼容任意模型,除 Command A+ 外还可接入企业自有模型,管理员可通过 North Admin 管理 token 用量、用户配额和访问权限,关键操作需人工批准。平台支持本地、云端或完全隔离部署,LG CNS 和 Bell Cyber 已在生产环境运行。
独立研究者 Syed Anas Mohiuddin 报告 Google、JPMorgan Chase、Weaviate、法国 DINUM 和印尼 Tangerang 市政府各自修复了 MCP 服务器中的同一类 SSRF 漏洞。
TikTok 在应用内新增 AI 购物助手与一键结账功能 Buy Direct,让用户无需离开应用即可直接向品牌下单。购物助手是会记住用户需求的对话式 AI 智能体,可回答商品详情、运费、尺码和库存问题并在同一对话中完成购买,功能与 Salesforce、Shopify、Shoplazza、Stripe 合作构建,未公布上线日期。
独立研究者 Syed Anas Mohiuddin 测试了 Google、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字局和美国联邦政府的智能体,用概念验证攻击利用 MCP 信任缺口。过去五个月里,Google 等五家组织承认漏洞可被用来从一个智能体向内部其他智能体传播恶意指令。这种提示词注入针对特定智能体而非 LLM,防护薄弱时指令会沿信任链传递。
Anthropic 的 Claude Opus 5.5 与 Claude Sonnet 5.5 在 AWS GovCloud (US) 上线,为 ITAR 等受监管工作负载提供 AI 辅助开发入口。
Amazon SageMaker AI optimized generative AI inference 推出 aws-ai-ml skill,通过 Agent Toolkit for AWS 提供,支持 Kiro、Claude Code、Codex 及任何兼容 MCP 的编码智能体。
Databricks 阐述 Genie Ontology 如何为 Genie 补充企业上下文:先基于 Unity Catalog 中经治理与认证的核心概念,再从仪表板、文档、查询、notebook 和连接应用学习知识,并由 OntoRank 按认证、使用与作者身份排序权威性。
Amazon Bedrock AgentCore Evaluations 支持内置与自定义评估器,用于衡量多智能体系统的准确性、任务成功率与行为质量。内置评估器覆盖 helpfulness、task success、instruction following 等通用维度,自定义评估器可检查约束满足、路径可行性、SQL 正确性、库存 grounding 与解释质量。
Amazon Quick 现可通过托管在 Amazon Bedrock AgentCore 上的 MCP 示例服务器 Quick Resource Migrator,将 chat agents、action connectors、knowledge bases、flows 和 spaces 从开发账户自动迁移到生产账户。
Cloudflare 在 Birthday Week 2026 共发布 46 项公告,围绕开源、应用安全、智能体经济和开发者平台展开。
Risotto 宣布推出「Autonomous IT Engineer」,一款面向复杂、模糊的 Tier-2 IT 工单的 AI 副驾驶,通过分析实时用户上下文与系统日志诊断问题并给出分步修复方案,经人工审批后执行。
论文提出 Comparative Inference for Tool-use Agents(CITA),训练比较推理模型(CIM)在执行前估计下一次工具调用对最终任务成功的长期价值。
论文提出一种差分测试方法,将固定工具结果追踪至各框架公开接口并校验消费者需求。在 18 个设计夹具、4 个 pinned Python 集成中识别出 13 个独特夹具任务分歧,涉及结构化值、声明错误和富内容。Google ADK 满足其观测路径上的全部主契约,其余集成出现接口特定变化或执行失败;研究提供可复现的接口级证据,而非生产故障率或模型行为测量。
summary_zh: Databricks 联合 OpenAI 与 Stellantis 探讨企业级智能体应用扩展,提出需在选择、上下文与控制三方面建设基础设施。
summary_zh: PyTorch Conference North America 2026 将于近日在圣何塞召开,Ray 作为分布式计算框架贯穿训练、部署与后训练全流程。
Google Cloud API Gateway 进入 Public Preview,可作为远程 MCP server,将已有 REST 操作直接暴露为 agent 可调用的 MCP 工具,无需单独搭建服务器。
Wabi 2.0 转型为 AI 消息应用,在对话中按需生成界面,帮助用户完成追踪日历、语言学习等任务。创始人 Eugenia Kuyda 认为最强智能体应结合聊天与软件体验。该应用目前仅通过邀请码开放。
Shopify宣布基于浏览器的AI智能体现在可以在商家网站完成购买,把此前的商品搜索和加购能力延伸到结账。结账与Shop Pay新增WebMCP支持,并提供get_checkout、update_checkout和complete_checkout,智能体可查看结账、修改地址或配送选项,并在买家授权后提交订单。该功能正在向所有合格Shopify商家推出。
Atlassian 联合创始人兼 CEO Mike Cannon-Brookes 在 The Verge 的 Decoder 访谈中反驳 SaaSpocalypse,认为前沿模型即使再增强,也难以独自运营充满合规、人员与创造性的复杂企业。
Hcompany 发布智能体模型 Holo4,提供 27B 稠密版与 35B-A3B MoE,并推出 Holotron4 Nano。
Why it matters: 同一模型同时覆盖图形界面、代码和工具调用,便于对照它在更低成本下与闭源模型的长流程得分差距。
summary_zh: Microsoft 将 Copilot 的聊天、Cowork、Office、编程工具和 Autopilot 整合到一款新应用中,多个重要功能仍处于预览版。
summary_zh: Amazon Bedrock AgentCore Gateway 与 Model Context Protocol(MCP)结合,让 AI Agent 在不复制或集中数据的前提下跨多个 AWS 账户查询。
Jev 现已开放给所有人使用,它是一个面向开发者的工具内 LLM,用户可向其提交文本并获取是/否判断、选项分类或相关性评分等答案。社区用它构建了跳过 YouTube 赞助片段、实时过滤聊天负面评论、按意图搜索 Gmail 等扩展。
MCP 并非坏主意,对于需要受控访问、认证隔离和审计日志的场景,它让这些能力更易实现。具备无限制网络访问的终端智能体(如 Claude Code、Codex、Meta Muse、OpenClaw)可直接调用 API,无需 MCP;认为 MCP 因全能编程智能体而不必要的看法,忽略了其他可构建的需求。
Cooley 基于 ChatGPT Work 构建了 GO Public 工具,将智能引入 IPO 流程,帮助律师更早发现潜在问题并聚焦关键判断。
summary_zh: Apple 据报道正在开发基于 M8 Ultra 处理器的 AI 服务器,并评估 NVLink Fusion 作为互联方案,预计 2029 年推出。
作者 Tommaso Stocchi 以滑雪度假村演示为例,对比 A2A 专家代理与基于 MCP 的分布式技能两种架构,并给出五步迁移流程。技能路径将专家指令移入编排器,由 SDK 直接加载 SKILL.md 并暴露 MCP 工具;实测显示技能路径模型调用更少(3 次 vs 6-7 次)、延迟更低,但总 token 数反而增加约 22%。
Why it matters: 通过同一应用的 A2A 与 MCP 两种架构对比,给出可迁移的迁移步骤与实测延迟和 token 数据,帮助读者判断是否将专家代理改为分布式技能。