Amazon Bedrock 在首尔和新加坡推出 Anthropic Claude 模型区域推理
Amazon Bedrock 在首尔(ap-northeast-2)和新加坡(ap-southeast-1)支持 Claude Opus 5 与 Claude Sonnet 5 的区域推理,请求在指定 Region 内处理且不跨区。
Amazon Bedrock 在首尔(ap-northeast-2)和新加坡(ap-southeast-1)支持 Claude Opus 5 与 Claude Sonnet 5 的区域推理,请求在指定 Region 内处理且不跨区。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。
推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。
summary_zh: Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日成立,为微软在东南亚首个研究实验室。
GitHub Copilot app 可用 /create-canvas 把自然语言描述变成在右侧面板打开、与智能体共享的 canvas。提示要写清工作流、使用者能直接操作的内容,以及智能体能添加或更新的事项,界面可以是看板、议题分拣板、发布清单、仪表盘、表单或表格。
NarrateAI 在 Amazon Bedrock 上实现五项协同的质量保障技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架与数据准确性验证。系统在约 13 秒内开始流式响应,数值准确率达 99.3%,六个月生产部署中无服务中断。
AWS博客演示如何用 SageMaker HyperPod 配合 Qumulo Cloud Native 与 Cloud Data Fabric 实现跨Region训练,数据保留在hub Region,spoke通过VPC peering和NeuralCache预热读取。
GitHub Copilot 推出 Canvas 功能,允许用户在应用内构建无浏览器边框的全栈应用界面,与 Agent 双向通信。Canvas 可调用第三方 API、在本地执行代码,用于构建游戏、管理 Winget 包、操作 SQLite 数据库或自动化开发工作流。
summary_zh: Amazon Bedrock AgentCore Gateway 与 Model Context Protocol(MCP)结合,让 AI Agent 在不复制或集中数据的前提下跨多个 AWS 账户查询。
Microsoft Agent Framework 发布 AG-UI 交互接入、FoundryMemoryProvider 记忆、CodeAct 执行与弹性后台执行四项更新,覆盖 .NET 与 Python,并提供 FastAPI 与 ASP.NET Core 示例。
推荐理由:原文给出了四项能力更新与跨语言示例,读者可据此判断哪些能力能直接接入现有应用。
HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。
推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。
GitHub Copilot 应用重写了 Pull Request 视图,以支持单文件变更量极大的 Pull Request。方案将代码几何与评论块几何分离,用惰性测量、滚动锚定和单通道调度避免跳动,并配合流式数据管道与缓存策略;实测在 2,200 文件、超百万行变更、400+ 行内评论的极端案例上仍保持流畅。
AWS 博客教程演示将 OpenCode 与 Amazon Bedrock 上的开源权重模型(Kimi K3、GPT-OSS 120B、Nemotron 3 Super 120B)配对,实现终端本地交互、推理在 AWS 账户内完成、无基础设施管理和按量付费。
Microsoft Research 在 Physical AI Toolchain 中新增行业首个机器人推理卸载能力,可将 SO-101、UR10e 等机器人的推理从机载 GPU 卸载至边缘或云 GPU。实验显示,卸载改善了移动操作任务的成功率、响应精度和电池续航,并支持通过 Kubernetes 自动容器化与编排。
推荐理由:首次系统量化了机器人推理卸载的收益,为物理 AI 基础设施选型提供可对比的实测依据。
Microsoft Agent Framework 发布 Foundry 托管代理隔离,包含用户隔离和 Foundry 托管会话隔离两个独立控制,分别对应调用者身份和沙箱会话。开发者可使用 .NET 和 Python SDK 通过 AgentSession 传入 delegated user identity 或显式 agent_session_id,实现共享沙箱或独立会话等部署模式。
推荐理由:原文给出了用户隔离与会话隔离两套控制及多种可用模式,读者可据此评估自身应用在数据归属和会话生命周期上的选择。
RetroChimera用学习排序融合R-SMILES 2与NeuralLoc的互补预测,改进小分子逆合成预测。10个高难度目标中,其完整路线被接受9条,de novo、editing与NeuralSym分别为5、4、2条。模型发表于Nature并开源实现与权重,能召回稀有反应,也能在专有数据集上零样本迁移和微调。
GitHub Copilot运行时从TypeScript重写为Rust,由AI代理主导完成,超过80万行Rust代码。迁移过程实现了性能提升和跨产品共享运行时。
推荐理由:原文详细记录了使用Copilot代理将GitHub Copilot运行时从TypeScript迁移至Rust的过程,性能提升显著,并实现了多产品共享。
作者 Tommaso Stocchi 以滑雪度假村演示为例,对比 A2A 专家代理与基于 MCP 的分布式技能两种架构,并给出五步迁移流程。技能路径将专家指令移入编排器,由 SDK 直接加载 SKILL.md 并暴露 MCP 工具;实测显示技能路径模型调用更少(3 次 vs 6-7 次)、延迟更低,但总 token 数反而增加约 22%。
推荐理由:通过同一应用的 A2A 与 MCP 两种架构对比,给出可迁移的迁移步骤与实测延迟和 token 数据,帮助读者判断是否将专家代理改为分布式技能。
作者 Tomoko Tanaka 介绍如何将 GitHub Issues、Issue forms、Labels、GitHub Actions 与 Copilot agent skills 组合,把活动落地页生成、UTM 链接、邀请邮件、注册名单清洗、CRM 上传和报告等重复流程自动化。
推荐理由:作者以第一手经验展示如何用 GitHub Copilot 将重复营销流程自动化,读者可迁移该方法到自身有 API/CLI 入口的重复任务。
GitHub Copilot App 内置 diff、terminal 和 browser 面板,让用户在同一界面内审查 AI 代码更改、运行命令并预览功能,无需切换编辑器、终端和浏览器。
GitHub Copilot 发布 Project HydraFusion 研究预览,通过运行时多模型编排自动选择工作流以平衡性能、成本和延迟。在 TerminalBench 2.1 上比 Claude Opus 5 质量提升 4.9 个百分点且成本降低 67%,DeepSWE 和 CheckpointBench 上也接近 Opus 5 水平。
推荐理由:HydraFusion通过多模型编排自动选择最优工作流,在三个编码基准中以显著成本降低逼近Claude Opus 5的性能,为开发者提供无需手动协调模型的前沿质量编码体验。
GitHub Copilot app 支持同时运行多个智能体,每个会话相互独立,并可各自基于独立的 Git worktree 并行执行、保留自身上下文。用户在 sessions view 中可通过卡片查看各会话标题与任务进度,自由切换且无需重新说明上下文。以 tailspin-toys
GitHub Engineering 公布 GitHub Copilot 的四项成本优化:选择性压缩重复输出、移除文件读取行号前缀、缩短任务工具提示词、批量送达后台完成结果。离线基准与在线实验显示平均成本下降约 2.3%–5%,无质量回归;强调应按完整任务而非单次工具调用评估效率。
推荐理由:GitHub Copilot 通过四项工程优化降低 AI 编码成本,读者可据此理解上下文压缩与提示精简的边界。
Skala 1.1 在 GMTKN55 上加权误差达 2.8 kcal/mol,在 55 个类别中 32 个达到最优,同时保持半局域泛函的计算效率。Skala 已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP;微软研究院同步推出持续更新的性能基准报告。
推荐理由:原文给出精度提升与多软件集成进展,读者可据此评估 Skala 在现有计算化学工作流中的可用性。
微软研究院的新基准 MindTopo 发现,专有与开放权重多模态模型在静态拓扑推理上明显强于交互规划,且都远低于人类。它按连续性、分离、顺序、包围和绳结五类,测试静态场景问答,以及模拟环境中须维持或改变关系的动作规划。规划失败常在理解场景之后出现,模型失去对结构关系的追踪,或提出违反环境约束的动作。
CARE-X是微软研究介绍的胸部X光统一视觉语言模型,结合生成式报告与结构化预测并通过DAPO奖励对齐学习优化临床正确性。该模型在ReXVQA基准达到94%准确率,并在印度Narayana Health临床数据上验证了罕见ICU病理检测效果。工具增强测量实验显示,Qwen3-VL-4B-Instruct结合确定性计算工具后,测量依赖条件的F1平均提升43.6个百分点。
推荐理由:CARE-X通过联合训练生成与判别能力,在统一模型中实现灵活报告生成与校准预测,为放射学人工智能提供了可迁移的多任务优化方法。
Microsoft Research 发布开源框架 Orchard,核心是 Orchard Env,一个基于 Kubernetes 的可复用环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。
推荐理由:开源框架 Orchard 把训练、评估与真实部署 harness 打通,让小参数模型也能在 SWE-bench 等基准接近前沿系统。
Microsoft Research 发布 Echoverse,包含 10 个深度领域世界和 2 个能力世界,通过数据库锚定的真实状态与可重置环境训练计算机使用智能体。
推荐理由:高保真合成环境与模型共同进化的闭环设计,为计算机使用智能体提供了可复现的训练与评估新路径。
EvoLib是一个让大语言模型在推理过程中从自身经验自主学习的框架,无需真实标签或外部反馈,将过去尝试转化为可复用技能和反思性洞察。在数学推理、代码编写和长时序任务上,EvoLib一致优于检索式记忆方法,以更少token实现更高性能,并将测试时计算更有效地转化为性能增益。该框架无需模型更新,可应用于任何通过API部署的黑盒语言模型,且对任务顺序具有鲁棒性。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,支持一键进入 SageMaker Studio。
微软在 Build 2026 发布 Foundry Managed Compute,Hugging Face 模型现可通过一键部署在 Azure 上运行。模型目录每周更新,仅包含 SafeTensors 格式的安全筛选模型,支持 vLLM、SGLang、TensorRT-LLM、NIM、TEI、llama.cpp 等运行时,并提供统一端点、Azure Monitor 指标和每部署计费标签。
推荐理由:Hugging Face 模型现可通过 Foundry Managed Compute 一键部署,微软承担了从运行时构建、安全扫描到 CVE 补丁的运维层,让企业能在自有租户中运行开源模型。
MIT 和 Microsoft 研究人员开发了 Murakkab 系统,开发者可用自然语言描述意图,系统自动选择模型、工具并动态配置硬件资源。测试显示,该方法在视频问答和代码生成任务中仅用约 35% 的计算量、27% 的能耗和不到 25% 的成本,同时满足性能要求。
推荐理由:原文给出了具体优化幅度和动态配置方法,读者可以据此评估云上 Agent 工作流的能效潜力。
Mistral 发布 OCR 4,支持 170 种语言的单容器自托管文档解析,返回边界框、区块分类与内联置信度。
推荐理由:独立标注者平均 72% 偏好 OCR 4,配合单容器自托管与结构化输出,为企业 RAG 和智能体工作流提供了兼顾数据主权与提取精度的 OCR 方案。