Skip to content

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

201 selectedRelated topics开源生态数据与训练端侧 AI

Latest selected

61–80 of 201
Sep 25Fri
Sep 24Thu
  1. LangChain · Official74

    LangSmith Fine-Tuning 与 smithtune CLI 发布

    LangChain 推出 LangSmith Fine-Tuning 与 smithtune CLI,帮助团队将 LangSmith 轨迹转化为自定义微调模型,覆盖数据集构建、Fireworks 或 Baseten 训练及 LangSmith 评估全流程。

    Why it matters: 原文给出了从轨迹数据到微调部署的完整闭环,读者可以据此判断它能否降低自建数据流水线的成本。

  2. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-VL-3B DSpark 草稿模型加速视觉语言推理

    Liquid AI 为 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过推测解码在不改变输出质量的前提下加速推理。草稿模型增加 280M 参数(+8.9%),在 M5 Max 上解码加速 2.30x-3.13x、端到端加速 1.56x-2.62x;在 H100 上解码加速 20.4x-2.66x、端到端加速 1.64x-2.27x。

    Why it matters: 原文给出了具体加速数据和多框架支持,读者可据此评估在边缘设备或 GPU 上部署该草稿模型的性价比。

  3. AWS Machine Learning Blog60

    HEMA 用 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL

    HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。

    Why it matters: 原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。

  4. Microsoft Research67

    Microsoft Research 发布 Physical AI Toolchain 推理卸载功能

    Microsoft Research 在 Physical AI Toolchain 中新增行业首个机器人推理卸载能力,可将 SO-101、UR10e 等机器人的推理从机载 GPU 卸载至边缘或云 GPU。实验显示,卸载改善了移动操作任务的成功率、响应精度和电池续航,并支持通过 Kubernetes 自动容器化与编排。

    Why it matters: 首次系统量化了机器人推理卸载的收益,为物理 AI 基础设施选型提供可对比的实测依据。

Sep 23Wed
  1. AWS Machine Learning Blog69

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。

    Why it matters: 原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。

Sep 22Tue
  1. PyTorch Blog69

    vLLM 引入硬件无关层以支持多样化硬件

    vLLM 推出硬件无关(HW agnostic)层,确保项目在推进前沿 GPU 性能工程的同时,继续支持旧 GPU、消费者级 GPU 和树外加速器。新层保持 fullgraph torch.compile 兼容、可扩展、与硬件特定路径隔离,并使用原生 PyTorch 或可移植 DSL 实现。

    Why it matters: vLLM 新增硬件无关层,让关心多硬件和旧 GPU 的用户在不牺牲可移植性的前提下继续使用。

  2. PyTorch Blog83

    Shopify 用 PyTorch 和 vLLM 构建持续学习闭环

    Shopify 展示了如何用 PyTorch 和 vLLM 把生产失败压缩进模型权重,每天迭代并超越前沿模型,同时把服务成本降低 96%。流程包括:定义质量并校准评审器、用 autoresearch 优化 harness、从生产流量中挖掘难例并由前沿推理模型生成训练信号,再通过 SFT 和 GRPO 把修复轨迹写回权重,最后用 Gist 压缩系统提示以降低延迟和成本。

    Why it matters: 原文给出了从质量定义到自愈流水线的完整方法链,读者可据此理解如何把生产失败转化为模型参数更新。

  3. Microsoft Semantic Kernel60

    Microsoft Agent Framework 推出 Foundry 托管代理隔离功能

    Microsoft Agent Framework 发布 Foundry 托管代理隔离,包含用户隔离和 Foundry 托管会话隔离两个独立控制,分别对应调用者身份和沙箱会话。开发者可使用 .NET 和 Python SDK 通过 AgentSession 传入 delegated user identity 或显式 agent_session_id,实现共享沙箱或独立会话等部署模式。

    Why it matters: 原文给出了用户隔离与会话隔离两套控制及多种可用模式,读者可据此评估自身应用在数据归属和会话生命周期上的选择。

  4. Weaviate Blog72

    Engram 代理记忆实战指南

    Weaviate 发布 Engram 托管记忆与上下文服务,演示如何通过主题描述、边界、作用域与检索模式控制代理记忆。原文给出从 raw 数据到记忆的流水线、主题描述决定记忆内容与形态、bounded 与 scope 的行为差异,以及四种提示词布局下的缓存与计费对比。

    Why it matters: 原文通过真实输出演示了四个配置决策如何改变代理的记忆行为,读者可依此调整自己的主题描述与提示词布局。

Sep 21Mon
  1. Hugging Face Blog62

    像物理学家一样剪枝大语言模型:块移除作为约束二元优化问题

    Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。

    Why it matters: 把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。

  2. Hugging Face Blog62

    tokenizers v1 发布:编码、解码与扩展性实测

    Hugging Face 发布 tokenizers v1 预览版,在 Apple M4 Max 上单线程编码速度比 v0.23 快 3 到 30 倍,8 线程扩展效率达 76%。主要改进包括 bitcannon 位流分词、线程本地词缓存、无分配合并循环和批量模型调用,且输出 token ID 与 v0.23 完全一致。

    Why it matters: 原文给出了速度提升和开放入口,读者可以据此判断它会怎样改变现有工作流。

Sep 18Fri
  1. LangChain · Official75

    Included Health 基于 LangGraph 与 Deep Agents 构建联邦医疗导航智能体

    Included Health 推出基于 LangGraph 与 Deep Agents 的 Dot 医疗导航智能体,采用联邦多智能体架构处理保险、预约与专科转介等场景。系统通过共享技能注册表与全局语气提示保持跨团队一致性,并内置人工介入与 LangSmith 临床审核闭环。上线后聊天参与度提升 75%,临床路由一致率超 95%,高风险识别率超 99%。

    Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。