跳到正文

#部署/工程

今日 67 条
9月22日周二
  1. Microsoft Semantic Kernel60

    Microsoft Agent Framework 推出 Foundry 托管代理隔离功能

    Microsoft Agent Framework 发布 Foundry 托管代理隔离,包含用户隔离和 Foundry 托管会话隔离两个独立控制,分别对应调用者身份和沙箱会话。开发者可使用 .NET 和 Python SDK 通过 AgentSession 传入 delegated user identity 或显式 agent_session_id,实现共享沙箱或独立会话等部署模式。

    推荐理由:原文给出了用户隔离与会话隔离两套控制及多种可用模式,读者可据此评估自身应用在数据归属和会话生命周期上的选择。

  2. Weaviate Blog72

    Engram 代理记忆实战指南

    Weaviate 发布 Engram 托管记忆与上下文服务,演示如何通过主题描述、边界、作用域与检索模式控制代理记忆。原文给出从 raw 数据到记忆的流水线、主题描述决定记忆内容与形态、bounded 与 scope 的行为差异,以及四种提示词布局下的缓存与计费对比。

    推荐理由:原文通过真实输出演示了四个配置决策如何改变代理的记忆行为,读者可依此调整自己的主题描述与提示词布局。

  3. NVIDIA Blog31

    NVIDIA DSX Ready 发布,为AI工厂电源与冷却产品提供认证

    NVIDIA推出DSX Ready认证计划,用于评定AI工厂电源与冷却产品是否符合DSX参考设计要求。计划初始覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类,Hitachi Energy、LG Energy Solution、Tesla及LG Electronics、LiquidStack、Vertiv等合作伙伴产品已获认证。该计划帮助建设者降低集成风险,但通过认证不替代现场工程评估。

9月21日周一
  1. Hugging Face Blog62

    像物理学家一样剪枝大语言模型:块移除作为约束二元优化问题

    Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。

    推荐理由:把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。

  2. NVIDIA Blog30

    5 家公司用 NVIDIA AI 推进清洁能源

    NVIDIA 在纽约气候周重点介绍五家用 AI 推进清洁能源的公司,覆盖电网、核电、储能与聚变。ThinkLabs AI 基于 NVIDIA CUDA 的数字孪生与 agents 帮助 Southern California Edison 把电网互联评估从 30-45 天缩短到 2 分钟,Atomic Canyon 的 Neutron 和 NIVA 平台服务于核电运营。

  3. Hugging Face Blog62

    tokenizers v1 发布:编码、解码与扩展性实测

    Hugging Face 发布 tokenizers v1 预览版,在 Apple M4 Max 上单线程编码速度比 v0.23 快 3 到 30 倍,8 线程扩展效率达 76%。主要改进包括 bitcannon 位流分词、线程本地词缓存、无分配合并循环和批量模型调用,且输出 token ID 与 v0.23 完全一致。

    推荐理由:原文给出了速度提升和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月19日周六
  1. Google Research34

    MilleMiglia:面向中段物流的真实实例生成器

    Google Research 推出 MilleMiglia,一个 C++ 实例生成器,用于构建中段物流网络的真实基准。中段物流覆盖区域或大陆尺度的配送中心间运输,占物流成本大头且影响时效,但学术研究长期缺乏公开高质量数据。MilleMiglia 在 GitHub 开源,通过隐私保护的方式捕捉中段运输的多车辆接力、时间窗口与分拣同步等约束,为后续优化研究提供基础。

9月18日周五
9月17日周四
  1. PyTorch Blog67

    PyTorch Blog:Low Precision Flash Attention 4 支持MXFP8前向与反向

    PyTorch Blog发布Low Precision Flash Attention 4,在Blackwell上扩展MXFP8前向与反向,前向达2.85 PF/s、反向达2 PF/s,LLM形状较BF16加速1.6×和1.52×。代码已开源至ads_model_kernel_library/lp_fa4。

    推荐理由:原文给出了MXFP8前向与反向的PFLOP/s数据及开源地址,读者可据此评估Blackwell训练栈的实际加速效果。

  2. NVIDIA Developer · AI33

    cuTile Rust (cutile-rs):用 Agentic AI 将 CUDA Tile 操作从 Python 迁移至 Rust

    cuTile Rust (cutile-rs) 是一个基于瓦片的系统,用于在 Rust 语言中安全、惯用地编写 GPU kernel。它扩展了 Rust 所有权模型到瓦片式 GPU kernel,将可变输出拆分为不相交片段,并在 kernel 启动间保持宿主端所有权契约。程序员可在需要更低级控制时局部选择退出。

9月16日周三
  1. NVIDIA Blog62

    曼彻斯特大学利用 NVIDIA Earth-2 预测英国空气污染

    曼彻斯特大学与 NVIDIA Earth-2 团队基于 Isambard-AI 训练 Earth-2 CorrDiff 和 StormCast,生成了分辨率 2-3 平方公里的英国全域污染模型,训练仅用两天。同一工作流可在 DGX Spark 桌面系统运行推理,作者计划开源训练数据与工作流,并展望由智能体接口驱动的实时污染问答。

    推荐理由:展示了生成式AI模型从国家级超算到桌面设备的可迁移路径,降低了污染建模的硬件门槛。

  2. Together AI40

    从闭源模型迁移到开源模型,Together AI 发布迁移指南

    Together AI 发布从闭源迁移到开源模型(OSM)的策略指南,采用托管服务可将迁移时间从数月/年缩短至数周。指南建议通过定义用例、筛选相关基准(如 FrontierCode、LMArena、τ-bench 等)锁定候选模型,并基于每任务成本、token 消耗和延迟进行对比,最终用真实流量回放做准确性与性能评估。

  3. Apple Machine Learning Research73

    Shared Selective Persistent Memory for Agentic LLM Systems

    Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。

    推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。

  4. NVIDIA Blog65

    NVIDIA AI Infra Summit 发布 Vera Rubin 与 DSX 平台升级,展示每瓦特 token 优化成果

    NVIDIA 在 AI Infra Summit 公布 Vera Rubin NVL72 与 DSX 平台新成果,MLPerf Inference v6.1 中 Vera Rubin NVL72 较 GB300 NVL72 吞吐量提升最高 3.7 倍,DSX MaxLPS 在相同功耗下集群 token 吞吐量提升 24%、每瓦性能提升 23%。

    推荐理由:AI基础设施的关键指标正从峰值性能转向每兆瓦智能体token数,读者可据此评估自身AI工厂的能效与扩容空间。

9月15日周二