跳到正文

#部署/工程

今日 18 条
9月25日周五
  1. Amazon Science60

    Reactor 与 Amazon Neuron Science 合作实现 Trainium 上的实时视频生成

    Reactor 与 Amazon Neuron Science 团队合作,在 Trainium 上实现了基于 Rolling Forcing 的实时视频生成。团队采用以 NKI 为中心的底层优化,将 3D-RoPE 从 5 秒降至 1.8 毫秒,缓存拷贝从 23 毫秒降至 1.9 毫秒,并采用混合分片策略与模型代码合并,使管道仅用 11 GB 高带宽内存即达成 16 fps 以上的实时生成。

    推荐理由:原文给出了具体优化路径与实测数据,读者可据此判断 Trainium 在实时视频生成上的可行性边界。

  2. Ben's Bites · News22

    50 years of tech devices

    Ben 用了 Astra、Codex、Factory Droid 和多个 subagent 搭建了一个设备时间轴网站 bentossell.com/devices,展示 1976 到 2026 年共 87 款设备,所有图片由 Astra 生成。用户可拖动时间轴查看不同年份的设备,并投票"had/wanted",结果通过链接分享;投票数据由 here.now 存储,页面不存数据无需登录。

  3. AWS Machine Learning Blog36

    Aderant 使用 Amazon Nova Lite 构建智能工单分诊系统

    Aderant 基于 Amazon Nova Lite 和 Amazon Bedrock 构建智能工单分诊系统,自动化上下文收集、分类、路由与知识增强。系统每小时处理未分配工单,前 2.5 周审查 109 个工单,路由准确率约 96%,每周节省 8–14 工时,月运营成本低于 $30。低于置信度的工单仍由人工复核,团队通过 CloudWatch 监控并每周优化提示词与路由逻辑。

9月24日周四
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-VL-3B DSpark 草稿模型加速视觉语言推理

    Liquid AI 为 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过推测解码在不改变输出质量的前提下加速推理。草稿模型增加 280M 参数(+8.9%),在 M5 Max 上解码加速 2.30x-3.13x、端到端加速 1.56x-2.62x;在 H100 上解码加速 20.4x-2.66x、端到端加速 1.64x-2.27x。

    推荐理由:原文给出了具体加速数据和多框架支持,读者可据此评估在边缘设备或 GPU 上部署该草稿模型的性价比。

  2. AWS Machine Learning Blog60

    HEMA 用 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL

    HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。

    推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。

  3. GitHub Blog · AI & ML59

    GitHub Copilot 应用渲染超大 Pull Request

    GitHub Copilot 应用重写了 Pull Request 视图,以支持单文件变更量极大的 Pull Request。方案将代码几何与评论块几何分离,用惰性测量、滚动锚定和单通道调度避免跳动,并配合流式数据管道与缓存策略;实测在 2,200 文件、超百万行变更、400+ 行内评论的极端案例上仍保持流畅。

  4. Microsoft Research67

    Microsoft Research 发布 Physical AI Toolchain 推理卸载功能

    Microsoft Research 在 Physical AI Toolchain 中新增行业首个机器人推理卸载能力,可将 SO-101、UR10e 等机器人的推理从机载 GPU 卸载至边缘或云 GPU。实验显示,卸载改善了移动操作任务的成功率、响应精度和电池续航,并支持通过 Kubernetes 自动容器化与编排。

    推荐理由:首次系统量化了机器人推理卸载的收益,为物理 AI 基础设施选型提供可对比的实测依据。

9月23日周三
  1. NVIDIA Blog18

    Sakeena Fiza 助力 NVIDIA 硬件规模化成功

    NVIDIA 验证工程师 Sakeena Fiza 负责量产前验证数据中心系统,曾见证 Rubin GPU 全球首次在系统级成功枚举。她与团队从 tray、rack、cluster 一路验证到客户 AI factory,目标是在客户之前发现硬件问题。单块板卡含数万组件、机架接近 50 万,验证需在真实条件下把硬件推向极限。

  2. AWS Machine Learning Blog69

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。

    推荐理由:原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。

9月22日周二
  1. Simon Willison29

    llm-typesafe 0.1a0 发布

    llm-typesafe 0.1a0 发布,为 llm 工具新增对 TypeSafe AI Jev 模型的支持。安装后可通过 noul 提问获得置信度分数(如 0.99),也支持 choice 和 scoring 两种按预设标准分类的提问方式。

  2. PyTorch Blog69

    vLLM 引入硬件无关层以支持多样化硬件

    vLLM 推出硬件无关(HW agnostic)层,确保项目在推进前沿 GPU 性能工程的同时,继续支持旧 GPU、消费者级 GPU 和树外加速器。新层保持 fullgraph torch.compile 兼容、可扩展、与硬件特定路径隔离,并使用原生 PyTorch 或可移植 DSL 实现。

    推荐理由:vLLM 新增硬件无关层,让关心多硬件和旧 GPU 的用户在不牺牲可移植性的前提下继续使用。

  3. IEEE Spectrum · AI35

    无风扇AI服务器:液冷实现近全热捕获

    CoolIT推出基于模块化冷板块的液冷方案,在250 kW以上机架密度下实现近全热捕获,空气负载降至1%以下,使AI服务器可无风扇运行。该方案已通过六代无风扇设计验证,覆盖处理器、内存、网络、存储和电源等组件。CoolIT建模预测近全热捕获将成为2028年前旗舰机架级产品的标准设计。

  4. Microsoft Semantic Kernel60

    Microsoft Agent Framework 推出 Foundry 托管代理隔离功能

    Microsoft Agent Framework 发布 Foundry 托管代理隔离,包含用户隔离和 Foundry 托管会话隔离两个独立控制,分别对应调用者身份和沙箱会话。开发者可使用 .NET 和 Python SDK 通过 AgentSession 传入 delegated user identity 或显式 agent_session_id,实现共享沙箱或独立会话等部署模式。

    推荐理由:原文给出了用户隔离与会话隔离两套控制及多种可用模式,读者可据此评估自身应用在数据归属和会话生命周期上的选择。

  5. Weaviate Blog72

    Engram 代理记忆实战指南

    Weaviate 发布 Engram 托管记忆与上下文服务,演示如何通过主题描述、边界、作用域与检索模式控制代理记忆。原文给出从 raw 数据到记忆的流水线、主题描述决定记忆内容与形态、bounded 与 scope 的行为差异,以及四种提示词布局下的缓存与计费对比。

    推荐理由:原文通过真实输出演示了四个配置决策如何改变代理的记忆行为,读者可依此调整自己的主题描述与提示词布局。

  6. NVIDIA Blog31

    NVIDIA DSX Ready 发布,为AI工厂电源与冷却产品提供认证

    NVIDIA推出DSX Ready认证计划,用于评定AI工厂电源与冷却产品是否符合DSX参考设计要求。计划初始覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类,Hitachi Energy、LG Energy Solution、Tesla及LG Electronics、LiquidStack、Vertiv等合作伙伴产品已获认证。该计划帮助建设者降低集成风险,但通过认证不替代现场工程评估。

9月21日周一
  1. Hugging Face Blog62

    像物理学家一样剪枝大语言模型:块移除作为约束二元优化问题

    Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。

    推荐理由:把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。

  2. NVIDIA Blog30

    5 家公司用 NVIDIA AI 推进清洁能源

    NVIDIA 在纽约气候周重点介绍五家用 AI 推进清洁能源的公司,覆盖电网、核电、储能与聚变。ThinkLabs AI 基于 NVIDIA CUDA 的数字孪生与 agents 帮助 Southern California Edison 把电网互联评估从 30-45 天缩短到 2 分钟,Atomic Canyon 的 Neutron 和 NIVA 平台服务于核电运营。