Antigravity SDK 新增本地 AI 模型支持
Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。
推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。
推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。
DeepSeek正式开源面向华为昇腾算力平台的基础设施组件,涵盖TileLang编译工具、高性能计算库、分布式通信库及DeepEP通信库。
推荐理由:DeepSeek与华为联合开放昇腾侧的基础设施与部署实践,为国产算力平台提供了可复用的软件栈参考。
OpenAI 在 DevDay 2026 推出由 GPT-6 Astra 驱动的 24 小时智能体助理 dots,以及 ChatGPT Space、Codex Cloud、Decisions API 和 GPT-6.1 Sol 等 20 多项更新。
推荐理由:OpenAI 把 ChatGPT 推向持续存在的 SaaS 工作流,并推出高性价比的 GPT-6.1 Sol,读者可以据此判断它对个人用户成本和企业部署的实际影响。
Ollama 0.35 推出 /v1/systemone 端点,支持 Jev 风格的决策模型,本地运行无额外成本且延迟更低。今日上线三个模型:nimble(9B,Bespoke Labs)、tev1(4B,Together AI)和 tev1:0.8b(0.8B,Together AI)。
推荐理由:本地低延迟决策模型开放调用,对实时分拣、路由与审核场景有直接迁移价值。
Reactor 与 Amazon Neuron Science 团队合作,在 Trainium 上实现了基于 Rolling Forcing 的实时视频生成。团队采用以 NKI 为中心的底层优化,将 3D-RoPE 从 5 秒降至 1.8 毫秒,缓存拷贝从 23 毫秒降至 1.9 毫秒,并采用混合分片策略与模型代码合并,使管道仅用 11 GB 高带宽内存即达成 16 fps 以上的实时生成。
推荐理由:原文给出了具体优化路径与实测数据,读者可据此判断 Trainium 在实时视频生成上的可行性边界。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,基于 GitHub Security Lab Taskflow Agent 框架。
推荐理由:原文给出了一个可自主运行的模糊测试流水线,读者可以据此理解 LLM 代理在安全自动化中的决策与执行分离设计。
Microsoft Agent Framework 发布 AG-UI 交互接入、FoundryMemoryProvider 记忆、CodeAct 执行与弹性后台执行四项更新,覆盖 .NET 与 Python,并提供 FastAPI 与 ASP.NET Core 示例。
推荐理由:原文给出了四项能力更新与跨语言示例,读者可据此判断哪些能力能直接接入现有应用。
Liquid AI 为 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过推测解码在不改变输出质量的前提下加速推理。草稿模型增加 280M 参数(+8.9%),在 M5 Max 上解码加速 2.30x-3.13x、端到端加速 1.56x-2.62x;在 H100 上解码加速 20.4x-2.66x、端到端加速 1.64x-2.27x。
推荐理由:原文给出了具体加速数据和多框架支持,读者可据此评估在边缘设备或 GPU 上部署该草稿模型的性价比。
HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。
推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。
Microsoft Research 在 Physical AI Toolchain 中新增行业首个机器人推理卸载能力,可将 SO-101、UR10e 等机器人的推理从机载 GPU 卸载至边缘或云 GPU。实验显示,卸载改善了移动操作任务的成功率、响应精度和电池续航,并支持通过 Kubernetes 自动容器化与编排。
推荐理由:首次系统量化了机器人推理卸载的收益,为物理 AI 基础设施选型提供可对比的实测依据。
Together AI 发布教程,演示基于 Qwen3.5 4B 和 Hugging Face 多源数据集微调 Jev 类分类模型,训练成本约17美元,耗时约25分钟,并部署到 Together AI 专用端点。
推荐理由:原文给出了从数据准备到部署的完整流程,读者可以按此低成本复现一个专用分类模型。
GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。
推荐理由:原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。
Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。
推荐理由:原文对比 Opus 5 给出 token 效率与定价变化,并附 Bedrock 调用方式,便于判断迁移成本与接入路径。
vLLM 推出硬件无关(HW agnostic)层,确保项目在推进前沿 GPU 性能工程的同时,继续支持旧 GPU、消费者级 GPU 和树外加速器。新层保持 fullgraph torch.compile 兼容、可扩展、与硬件特定路径隔离,并使用原生 PyTorch 或可移植 DSL 实现。
推荐理由:vLLM 新增硬件无关层,让关心多硬件和旧 GPU 的用户在不牺牲可移植性的前提下继续使用。
Microsoft Agent Framework 发布 Foundry 托管代理隔离,包含用户隔离和 Foundry 托管会话隔离两个独立控制,分别对应调用者身份和沙箱会话。开发者可使用 .NET 和 Python SDK 通过 AgentSession 传入 delegated user identity 或显式 agent_session_id,实现共享沙箱或独立会话等部署模式。
推荐理由:原文给出了用户隔离与会话隔离两套控制及多种可用模式,读者可据此评估自身应用在数据归属和会话生命周期上的选择。
Together AI 发布 Canary Rollouts 功能,支持在同一个端点上以 canary、blue-green、rolling 三种策略将流量从源模型逐步迁移到目标模型,并在每步执行健康检查与指标门控。
推荐理由:平台将人工回滚转为自动化阶梯流量与健康检查,适合在生产环境替换模型时控制风险。
Weaviate 发布 Engram 托管记忆与上下文服务,演示如何通过主题描述、边界、作用域与检索模式控制代理记忆。原文给出从 raw 数据到记忆的流水线、主题描述决定记忆内容与形态、bounded 与 scope 的行为差异,以及四种提示词布局下的缓存与计费对比。
推荐理由:原文通过真实输出演示了四个配置决策如何改变代理的记忆行为,读者可依此调整自己的主题描述与提示词布局。
Hugging Face 的 transformers 库新增 GGUF 模型支持,用户可通过熟悉的 API 在 Apple Silicon Mac 上运行 llama.cpp 量化 checkpoint。
推荐理由:transformers 新增 GGUF 支持,在 Apple Silicon 上通过熟悉 API 运行量化模型,性能接近 llama.cpp,为本地推理提供便捷入口。
Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。
推荐理由:把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。
Hugging Face 发布 tokenizers v1 预览版,在 Apple M4 Max 上单线程编码速度比 v0.23 快 3 到 30 倍,8 线程扩展效率达 76%。主要改进包括 bitcannon 位流分词、线程本地词缓存、无分配合并循环和批量模型调用,且输出 token ID 与 v0.23 完全一致。
推荐理由:原文给出了速度提升和开放入口,读者可以据此判断它会怎样改变现有工作流。