Antigravity SDK 新增本地 AI 模型支持
Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。
推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。
Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。
推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。
Google Cloud API Gateway 进入 Public Preview,可作为远程 MCP server,将已有 REST 操作直接暴露为 agent 可调用的 MCP 工具,无需单独搭建服务器。
IMPACT 是一个面向云边微服务迁移与带宽控制的意图驱动 Agentic AI 框架,采用集中训练分散执行(CTDE),将每个边缘云建模为自主智能体并编码局部 SLO 风险、迁移紧迫性与计算压力。实验表明,在 5 边缘和 20 边缘场景下,IMPACT 相比现有因子化多智能体强化学习与启发式基线,平均延迟降低 30-50%,尾延迟偏差降低 40-70%,在严格阈值下实现接近零的 SLO 违约率。
SPECTRA 是一种轻量级自主请求框架,通过显著性引导的定向扰动和高效认知轨迹分析,在预填充阶段量化智能体高维认知轨迹的拓扑发散,避免低效的输出解码。实验表明,GTA1-32B+InfiGUI-G1-3B 和 GTA1-32B+Holo1.5-3B 分别以 37.58% 和 39.24% 的平均请求率,保留了 93.44% 和 95.60% 的云端独占性能。已被 ACM MM 2026 接收。
研究提出 Agent-Callable Feature Coverage(ACFC)指标与 Agent Readiness Conformance(ARC)框架,从可访问性、可发现性、可控性三轴评分(0-9)。
summary_zh: Qiskit 量子编译器提出一种防泄漏、成本感知的回归测试选择方法,预注册预算绑定评估避免数据泄漏。
Amazon Bedrock 在首尔(ap-northeast-2)和新加坡(ap-southeast-1)支持 Claude Opus 5 与 Claude Sonnet 5 的区域推理,请求在指定 Region 内处理且不跨区。
Amazon Bedrock 在印度推出地理跨区推理,端点覆盖 ap-south-1 与 ap-south-2,Claude Opus 5、Claude Sonnet 5、Claude Haiku 4.5 可在印度区域内处理数据。
summary_zh: OpenAI DevDay 2026 发布 20 余项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具。
summary_zh: NVIDIA TensorRT Model Connect 是一个基于 TensorRT 的 C++ AI 模型参考实现开源项目。项目采用并行开发、模型族隔离、可逆变更和 GPU 验证等方式,围绕编程智能体进行设计,旨在让 NVIDIA 推理栈的性能更易被访问。
GitHub 推出外部自定义属性功能,允许将 CMDB、内部开发者门户等外部系统中的业务上下文同步到仓库。该功能处于公开预览期,外部系统独占拥有并持续更新,GitHub UI 中只读。Port.io 是首个集成伙伴,企业也可通过外部自定义属性 API 自建集成。
NVIDIA 发布 VSS Blueprint 3.3,通过 Metropolis 视频搜索与摘要蓝图及 agent skills,帮助开发者构建可维护的视觉 AI Agent 系统,整合视频摄入、流处理、事件检测、检索、摘要与报告等管线,以降低生产级视觉 AI Agent 的构建与运行成本。
Condé Nast 与 AWS GenAIIC 合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索系统,使用 TwelveLabs Marengo 嵌入模型对视频转录、视觉和音频进行语义搜索,将内容发现时间从平均 250 分钟降至 2 分钟以内。
summary_zh: 该平台基于 AWS 构建,用 AI agents 从 250 份合同 PDF 中提取 8 个关键字段并独立核验,签名分歧由 Amazon Textract 计算机视觉裁决,结果存入 Amazon Aurora PostgreSQL。
Ollama 0.35 推出 /v1/systemone 端点,支持 Jev 风格的决策模型,本地运行无额外成本且延迟更低。今日上线三个模型:nimble(9B,Bespoke Labs)、tev1(4B,Together AI)和 tev1:0.8b(0.8B,Together AI)。
推荐理由:本地低延迟决策模型开放调用,对实时分拣、路由与审核场景有直接迁移价值。
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
summary_zh: Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日成立,为微软在东南亚首个研究实验室。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
在 Amazon SageMaker AI 上用 AWS vLLM-Omni DLC 部署 Qwen3-TTS,文本与音频经同一条持久双向连接传输,语音可在整段生成完成前开始播放。
同一 AWS vLLM-Omni DLC 在 SageMaker AI 部署两个端点:FLUX.2-klein-4B 实时生成图像,Wan2.1-VACE-1.3B 再异步把该图像做成短视频。
Mistral 在慕尼黑开设德国枢纽,专注 Physics AI 与工业 AI,并招募研究、工程与应用 AI 岗位。该公司计划到 2030 年建成 1 gigawatt 欧洲算力,其开放权重模型可运行在客户自有基础设施上。其收购的 Emmi AI 带来 30 多名物理与工程 AI 专家,正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用。
summary_zh: Amazon Nova Act 基于多模态大语言模型处理 UI 截图而非 DOM 选择器,在早期企业客户用例中浏览器工作流准确率超过 90%,能适应样式变化而无需更新脚本。
summary_zh: NVIDIA 发布 Open Agent Safety Platform,提供持续芯片内 Agent 监控的参考实现。平台面向 agentic AI 的安全需求,借鉴互联网早期经验,在模型运行时进行实时监测。
在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%。RLHF 与 GRPO 需同时平衡大规模 rollout 生成和紧耦合策略训练,两侧速率不匹配会让加速器空闲或引发训练不稳定。更稀疏的 MoE 使训练更受通信而非算力制约;作业超出单实例后,通信从节点内 NVLink 转到更低带宽的节点间链路。
summary_zh: SkyRL 是开源 RL 框架,结合 Amazon SageMaker HyperPod 的 Ray 集群与 GRPO 后训练,将 Qwen3-VL-8B 在 VisGym SFT 检查点上的迷宫求解率从 43.75% 提升至 95% 以上。
NarrateAI 在 Amazon Bedrock 上实现五项协同的质量保障技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架与数据准确性验证。系统在约 13 秒内开始流式响应,数值准确率达 99.3%,六个月生产部署中无服务中断。
Qwen3-TTS-12Hz-1.7B-Base 是阿里千问团队公开的文本转语音模型,支持 10 种语言、基于 12Hz 语音 tokenizer 与流式生成,可通过少量参考音频实现说话人声音克隆,并跨语言保持声音身份。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,用交互式仪表盘和自然语言搜索栏为工业气体与焊接分销商提供自助式租赁分析。TrackAbout 客户共管理 2750 万项资产、每月超 72.5 万张账单,此前取数需提交 SSRS 报表请求并等待数天甚至数周。
AWS博客演示如何用 SageMaker HyperPod 配合 Qumulo Cloud Native 与 Cloud Data Fabric 实现跨Region训练,数据保留在hub Region,spoke通过VPC peering和NeuralCache预热读取。
summary_zh: GitHub Primer 设计系统将组件从 CSS-in-JS 迁移至 CSS Modules,页面服务端渲染时间减少 55%,组件初始化时间减少 25%。
Reactor 与 Amazon Neuron Science 团队合作,在 Trainium 上实现了基于 Rolling Forcing 的实时视频生成。团队采用以 NKI 为中心的底层优化,将 3D-RoPE 从 5 秒降至 1.8 毫秒,缓存拷贝从 23 毫秒降至 1.9 毫秒,并采用混合分片策略与模型代码合并,使管道仅用 11 GB 高带宽内存即达成 16 fps 以上的实时生成。
推荐理由:原文给出了具体优化路径与实测数据,读者可据此判断 Trainium 在实时视频生成上的可行性边界。
PyTorch Foundation 在 PyTorch Conference North America 期间新增 Introduction Track,并于 2026 年 10 月 19 日在加州圣何塞举办全天 PyTorch Associate Training。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,基于 GitHub Security Lab Taskflow Agent 框架。
推荐理由:原文给出了一个可自主运行的模糊测试流水线,读者可以据此理解 LLM 代理在安全自动化中的决策与执行分离设计。
WhisperX 扩展 OpenAI Whisper,加入逐词时间戳、说话人标注和批量推理,将原始音频转为结构化转录文本。AWS WhisperX Deep Learning Container 打包所有依赖,部署到 SageMaker 实时或异步端点,无需自定义镜像。
summary_zh: Amazon Bedrock AgentCore Gateway 与 Model Context Protocol(MCP)结合,让 AI Agent 在不复制或集中数据的前提下跨多个 AWS 账户查询。
Aderant 基于 Amazon Nova Lite 和 Amazon Bedrock 构建智能工单分诊系统,自动化上下文收集、分类、路由与知识增强。系统每小时处理未分配工单,前 2.5 周审查 109 个工单,路由准确率约 96%,每周节省 8–14 工时,月运营成本低于 $30。低于置信度的工单仍由人工复核,团队通过 CloudWatch 监控并每周优化提示词与路由逻辑。
Microsoft Agent Framework 发布 AG-UI 交互接入、FoundryMemoryProvider 记忆、CodeAct 执行与弹性后台执行四项更新,覆盖 .NET 与 Python,并提供 FastAPI 与 ASP.NET Core 示例。
推荐理由:原文给出了四项能力更新与跨语言示例,读者可据此判断哪些能力能直接接入现有应用。
Liquid AI 为 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过推测解码在不改变输出质量的前提下加速推理。草稿模型增加 280M 参数(+8.9%),在 M5 Max 上解码加速 2.30x-3.13x、端到端加速 1.56x-2.62x;在 H100 上解码加速 20.4x-2.66x、端到端加速 1.64x-2.27x。
推荐理由:原文给出了具体加速数据和多框架支持,读者可据此评估在边缘设备或 GPU 上部署该草稿模型的性价比。
summary_zh: MIT Senseable City Lab学者出版新书《How AI Sees the City: Urban Visual Intelligence》,探讨视觉AI在城市研究中的应用与隐患。
PyTorch Foundation OSPO 与学术推广工作组在 PyTorchCon NA 2026 Day 0 举办学术工作坊,邀请使用 PyTorch、DeepSpeed、Helion、Ray、Safetensors、vLLM 的学术开源项目提交。