Skip to content

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

201 selectedRelated topics开源生态数据与训练端侧 AI

Latest selected

101–120 of 201
Sep 9Wed
  1. Kubernetes AI60

    Kubernetes v1.37 推进 Workload-Aware Scheduling

    Kubernetes v1.37 将 Workload/PodGroup API、gang scheduling 与 Workload-Aware Preemption 升级至 Beta,并引入支持多层拓扑约束与抢占策略的 CompositePodGroup API。

    Why it matters: 核心 WAS API 升级到 Beta 并引入 CompositePodGroup,用户可据此评估分层调度和抢占策略对分布式训练与推理工作流的影响。

Sep 3Thu
  1. Google DeepMind65

    Google DeepMind 发布 WeatherNext 3,全球天气 AI 模型分辨率提升至 5 公里并实现每小时更新

    Google DeepMind 发布 WeatherNext 3,改用实时卫星观测数据直接训练全球天气 AI 模型。模型以 5 公里分辨率、每小时更新生成预报,降水预报 CRPS 最高较 IMERG 提升 60%,并已集成至 Search、Gemini、Maps 及 Google Cloud 平台。

    Why it matters: WeatherNext 3 摒弃传统数值天气预报训练数据,改为直接使用实时卫星观测数据,将全球分辨率提升至5公里并实现每小时更新,降水预报CRPS最高改善60%。

  2. Hugging Face Blog61

    NeoMME高效多模态原生多语言编码器

    NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。

    Why it matters: 单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。

  3. Kubernetes AI65

    Kubernetes v1.37:HPA 支持将工作负载缩容至零

    Kubernetes v1.37 将 HPA 缩容至零功能从 Alpha 升级为 Beta 并默认启用,可基于对象指标或外部指标将工作负载缩至零再恢复。需配置外部指标适配器(如 Prometheus Adapter),并使用 ScaledToZero 状态区分自动缩容与手动暂停;升级前需确保 apiserver 与 controller-manager 均支持该功能。

    Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  4. GitHub Engineering69

    GitHub Copilot 四项优化降低 AI 编码成本且不牺牲任务质量

    GitHub Engineering 公布 GitHub Copilot 的四项成本优化:选择性压缩重复输出、移除文件读取行号前缀、缩短任务工具提示词、批量送达后台完成结果。离线基准与在线实验显示平均成本下降约 2.3%–5%,无质量回归;强调应按完整任务而非单次工具调用评估效率。

    Why it matters: GitHub Copilot 通过四项工程优化降低 AI 编码成本,读者可据此理解上下文压缩与提示精简的边界。

  5. NVIDIA Developer · AI60

    现代 CUDA 工具箱实践:逐步优化图像流水线

    NVIDIA 博主通过一个 RGB 转灰度并求分块中值的图像流水线示例,演示六步优化:改用 CCCL API 与 Compute Sanitizer 修复越界写入。

    Why it matters: 原文通过逐步优化实例展示了现代 CUDA 工具链的用法,读者可按相同路径调试、剖析并加速自己的 GPU 代码。

Sep 1Tue
  1. Hugging Face Blog64

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核库支持浏览器端本地 AI 推理

    Hugging Face 发布 @huggingface/kernels 库及 Fleet 众测工具,提供 207 个 WebGPU 内核,覆盖矩阵乘法、Softmax、LayerNormalization 等操作。

    Why it matters: Hugging Face发布207个WebGPU内核库,以版本化包形式提供可复用的GPU操作原语,并搭配Fleet众测平台收集真实硬件性能证据,为浏览器端本地AI推理奠定底层基础。

Aug 31Mon
  1. MIT News · AI64

    JuliaHub 发布 Dyad 3.0,以物理约束 AI 智能体加速复杂系统设计

    JuliaHub 推出 Dyad 3.0,帮助工程团队通过自主 AI 智能体完成物理仿真、安全分析与质量校验,并依据物理定律修正设计。Julia 用户已超 100 万,被用于模拟电路、气候建模、疫苗研发和飞机防撞系统。

    Why it matters: 原文给出 Dyad 3.0 的物理约束能力和 Boeing 等客户案例,读者可据此判断工程设计的自动化边界。

Aug 27Thu
  1. Microsoft Semantic Kernel60

    Agent Harness:让你的 claw 进入生产就绪

    Microsoft Agent Framework 教程第 4 部分,将个人财务助手拆分为共享 agent factory 加 console、hosted service、evals runner 三种宿主,并接入 OpenTelemetry 可观测性、Microsoft Purview 治理、Foundry 托管部署以及本地与托管评测。

    Why it matters: 通过共享 agent factory 配合三种宿主,把个人财务助手从本地玩具推进到可观测、可治理、可部署、可评测的生产级架构。

  2. LangChain · Official62

    LangChain 八月更新:Managed Deep Agents 与 LLM Gateway 进入公开测试

    LangChain 宣布 Managed Deep Agents 和 LLM Gateway 进入公开测试,前者支持一键部署到托管运行时并内置持久执行、沙箱和追踪,后者提供成本控制、速率限制、模型降级和敏感数据处理。LangSmith Engine 性能提升 2 倍以上,Tuned Evaluators 自动附加质量反馈,Deep Agents v0.7 将基础输入 token 减少 65%。

    Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  3. Weaviate Blog62

    Weaviate 1.39 发布:Boost 与 MMR 搜索功能正式可用

    Weaviate v1.39 已开源并在 Weaviate Cloud 上线,Boost API 与 MMR 多样性选择正式达到 GA,4-bit Rotational Quantization 进入预览,Search REST API 为实验性新端点。HNSW 快照改为自动写入与清理,减少提交日志磁盘占用并加速启动。gRPC-Web 自 v1.38.3 起默认启用。

    Why it matters: 两个搜索功能正式可用,4-bit量化与实验性REST API为向量检索提供了新的压缩与调用选项。

  4. LangChain · Official69

    LangSmith LLM Gateway:面向生产 Agent 的运行时控制层

    LangSmith LLM Gateway 进入公开 beta,作为 agent 与模型提供商之间的集中治理层,提供支出上限、速率限制、模型降级和敏感数据保护。

    Why it matters: 原文给出了集中式治理层的具体控制能力与多租户策略,读者可以据此评估它在生产环境中如何替代手动嵌入各 agent 的控制逻辑。

  5. LangChain · Official73

    LangGraph Platform 正式发布:部署与管理长时、有状态智能体

    LangGraph Platform 正式发布,提供一键部署、30 个 API 端点、水平扩展、持久化层与原生 LangGraph Studio,支持长时任务、异步协作与多智能体架构。自去年六月测试以来已有近 400 家公司使用,可独立使用或与 LangChain、LangGraph、LangSmith 搭配。

    Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

Aug 26Wed
  1. LangChain · Official72

    LangChain 联合 You.com 发布 EU 宏观分析 Deep Agent

    LangChain 与 You.com 联合发布基于 Deep Agents 的 EU 宏观分析 Agent,对 2025 年 27 个成员国 GDP 进行异常检测与归因,45 分钟完成、成本 $2.20。

    Why it matters: 展示了金融研究 Agent 的可审计架构与分层工作流,为需要合规追溯的 FSI 团队提供了可复用的工程模板。

Aug 25Tue
  1. Hugging Face Blog67

    Granite 4.2 推理模型构建方法解析

    IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。

    Why it matters: 详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。

Aug 21Fri
  1. Microsoft Research62

    Skala 1.1 发布并扩展至 CP2K、Psi4、FHI-aims、ORCA 和 VASP

    Skala 1.1 在 GMTKN55 上加权误差达 2.8 kcal/mol,在 55 个类别中 32 个达到最优,同时保持半局域泛函的计算效率。Skala 已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP;微软研究院同步推出持续更新的性能基准报告。

    Why it matters: 原文给出精度提升与多软件集成进展,读者可据此评估 Skala 在现有计算化学工作流中的可用性。

Aug 18Tue