跳到正文

#部署/工程

今日 18 条
9月21日周一
  1. Hugging Face Blog62

    tokenizers v1 发布:编码、解码与扩展性实测

    Hugging Face 发布 tokenizers v1 预览版,在 Apple M4 Max 上单线程编码速度比 v0.23 快 3 到 30 倍,8 线程扩展效率达 76%。主要改进包括 bitcannon 位流分词、线程本地词缓存、无分配合并循环和批量模型调用,且输出 token ID 与 v0.23 完全一致。

    推荐理由:原文给出了速度提升和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月19日周六
  1. Google Research34

    MilleMiglia:面向中段物流的真实实例生成器

    Google Research 推出 MilleMiglia,一个 C++ 实例生成器,用于构建中段物流网络的真实基准。中段物流覆盖区域或大陆尺度的配送中心间运输,占物流成本大头且影响时效,但学术研究长期缺乏公开高质量数据。MilleMiglia 在 GitHub 开源,通过隐私保护的方式捕捉中段运输的多车辆接力、时间窗口与分拣同步等约束,为后续优化研究提供基础。

9月18日周五
9月17日周四
9月16日周三
  1. IEEE Spectrum · AI12

    单相直接液冷被证实适用于未来十年超密集计算

    单相直接液冷通过冷板将水或水乙二醇冷却液直接循环至发热组件,以闭式回路带走热量。单个处理器功耗已超 1,000 瓦,单机柜散热超过 100 千瓦,远超风冷实际移除能力。该技术可支持更高芯片与机架密度,在更小占地面积内运行,是 AI 与高性能计算热管理的关键方案。

  2. Latent Space88

    TypeSafe 发布 Jev:专注决策而非文本生成的前沿模型

    TypeSafe 发布 Jev,基于 RLCD 训练,宣称比小型前沿 LLM 快 20–200 倍、便宜 40–400 倍,输出 token 免费。社区指出它并非通用语言模型,更接近结构化分类器或裁判模型,适合替代生产系统中的 LLM 路由与判断。

    推荐理由:原文给出 Jev 在延迟与成本上的具体倍数优势,读者可据此判断其是否值得替代现有分类器与路由策略。

  3. NVIDIA Blog62

    曼彻斯特大学利用 NVIDIA Earth-2 预测英国空气污染

    曼彻斯特大学与 NVIDIA Earth-2 团队基于 Isambard-AI 训练 Earth-2 CorrDiff 和 StormCast,生成了分辨率 2-3 平方公里的英国全域污染模型,训练仅用两天。同一工作流可在 DGX Spark 桌面系统运行推理,作者计划开源训练数据与工作流,并展望由智能体接口驱动的实时污染问答。

    推荐理由:展示了生成式AI模型从国家级超算到桌面设备的可迁移路径,降低了污染建模的硬件门槛。

  4. Together AI40

    从闭源模型迁移到开源模型,Together AI 发布迁移指南

    Together AI 发布从闭源迁移到开源模型(OSM)的策略指南,采用托管服务可将迁移时间从数月/年缩短至数周。指南建议通过定义用例、筛选相关基准(如 FrontierCode、LMArena、τ-bench 等)锁定候选模型,并基于每任务成本、token 消耗和延迟进行对比,最终用真实流量回放做准确性与性能评估。

  5. Apple Machine Learning Research73

    Shared Selective Persistent Memory for Agentic LLM Systems

    Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。

    推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。

  6. NVIDIA Blog65

    NVIDIA AI Infra Summit 发布 Vera Rubin 与 DSX 平台升级,展示每瓦特 token 优化成果

    NVIDIA 在 AI Infra Summit 公布 Vera Rubin NVL72 与 DSX 平台新成果,MLPerf Inference v6.1 中 Vera Rubin NVL72 较 GB300 NVL72 吞吐量提升最高 3.7 倍,DSX MaxLPS 在相同功耗下集群 token 吞吐量提升 24%、每瓦性能提升 23%。

    推荐理由:AI基础设施的关键指标正从峰值性能转向每兆瓦智能体token数,读者可据此评估自身AI工厂的能效与扩容空间。

9月15日周二
9月14日周一
  1. MIT News · AI44

    MIT衍生公司Atlas Building Composites将塑料废料转化为耐用建筑材料

    MIT衍生公司Atlas Building Composites开发AI驱动机器人制造平台,将一次性塑料转化为房屋地基、甲板、屋架等建筑构件。其无水塑料回收技术与大型复合增材制造技术已用于支撑谷仓、码头,并近期为美国陆军工程兵团提供回收复合屋架,在马萨诸塞州湿地建造40英尺桥梁。大型复合屋架可在13分钟内打印完成,承重超过4000磅;每个Atlas工厂单元每天可生产约一栋小型房屋的结构框架材料。

  2. MIT News · AI62

    MIT提出HardFlow方法使生成AI适用于安全关键场景

    MIT研究人员提出HardFlow算法,通过在生成过程末端而非中间步骤强制硬约束,使扩散模型和流匹配模型在机器人路径规划等安全关键场景中既满足严格约束又提升解质量。实验表明HardFlow在机器人操作、迷宫导航和文本引导图像编辑中实现完美约束满足,并在解质量上持续超越基线,计算时间与多数方法相当或更低。

    推荐理由:该方法在部署时即可对预训练生成模型施加硬约束而不重新训练,为机器人等安全关键场景提供了可即插即用的改进路径。

9月11日周五
  1. ScienceDaily · AI36

    DTU 纳米激光器有望将计算机能耗减半

    DTU 研究人员开发出紧凑型纳米激光器,可在室温下以极低能耗运行,未来有望将计算机能耗降低多达一半。该器件通过纳米腔结构在微观尺度集中光与电子的相互作用,已在 DTU Nanolab 清洁间中实现。每颗芯片可集成数千个此类激光器,实现芯片内光子通信,预计剩余技术挑战可在 5-10 年内解决。

  2. Together AI69

    Together AI 扩展微调服务:新增模型、实时指标与更细粒度控制

    Together AI 升级微调平台,新增 GLM-5.3、Kimi K2.7、DeepSeek-V4-Flash、Qwen 3.8-27B、Gemma 4 等开源模型支持,并引入实验实时追踪、Expert LoRA、早停、任意批量大小、样本权重、预飞行校验与打包控制等功能。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

9月10日周四
  1. Mistral AI39

    Cloudera 与 Mistral 达成合作,为企业数据带来专业化主权智能

    Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,支持在私有云、公有云、本地及完全气隙环境部署推理并保持控制。企业还可在受控环境用专有数据训练自有模型并保留数据与智能所有权,面向主权 AI 需求。Mistral 提到 Cloudera 平台承载 30 exabytes 客户管理数据。

  2. Together AI60

    ThunderKittens 在 NVIDIA Vera Rubin NVL72 上新增 NVFP4/FP8 GEMM 支持

    Together AI 内核团队在 Vera Rubin NVL72 上扩展 ThunderKittens,支持 NVFP4 与 FP8 GEMM,并通过双 K 步长、独占张量内存、更大共享内存、B 侧收集器与 Early A release 等优化,将 NVFP4 推至超 22 PFLOPS,与 cuBLAS 和 CuTE DSL 竞争。

    推荐理由:原文给出了在 Vera Rubin 上优化 NVFP4/FP8 GEMM 的具体方法与性能数据,读者可迁移这些调优思路到自家 Rubin 部署。

  3. Hugging Face Blog67

    Gradio Workflow 重建 AUTOMATIC1111 工作流

    Hugging Face 用 Gradio Workflow 重建了 AUTOMATIC1111 的核心功能,形成包含 11 条媒体管道、73 个节点的单一工作流画布,涵盖文生图、高分辨率修复、图生图、提示词矩阵、VLM 问答、检测到 inpaint 掩码、ControlNet 风格标注器、背景去除、PNG Info 读取和图生视频。

    推荐理由:原文展示了用同一套画布串联多种模型与媒体管道的构建方式,读者可据此评估 gr.Workflow 在多模态工作流中的可复用性。

  4. Together AI69

    Together AI 推出抢占式计算:相同算力半价

    Together AI 公开预览抢占式计算节点,算力与标准节点相同,按 sub-hourly 计费为按需价的 50%。回收时有 5 分钟 drain 窗口,节点标注 together.ai/compute-class=preemptible,适合可 checkpoint 或重试的短实验、推理突发和批处理任务。

    推荐理由:原文给出了成本变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  5. Hugging Face Blog63

    HF Jobs 上用 LoRA 实现异步 GRPO 训练:一个存储桶、一个代理、无需 NCCL

    TRL v1.14 的 AsyncGRPOTrainer 新增 LoRA 适配器仅同步功能,结合 HF Jobs Storage Bucket 挂载,使训练与推理可运行在独立机器上,无需 NCCL。五次实验将 500 步训练从 3h27m 优化至 53min,通过 token 预算批处理和提升并发请求数将瓶颈从训练端转移到生成端。

    推荐理由:通过LoRA适配器仅同步加存储桶挂载,训练与推理可部署在独立HF Jobs上无需NCCL,五次实验将500步训练从3小时27分压缩至53分钟。

9月9日周三
  1. Together AI64

    开源 AI 栈:模型、推理、网关与 Harness 的选型与组合指南

    Together AI 发布开源 AI 栈指南,将栈分为模型、推理、网关与路由器、Harness、工具与上下文管理五层。推荐同时使用大模型(如 Kimi K3,1.8T 总参数)与小模型(如 GLM 5.3 Flash,320B 总参数)处理不同复杂度的任务,并可通过 OpenRouter、Vercel AI Gateway 或 LiteLLM 路由多提供商。

    推荐理由:原文分层拆解开源 AI 栈各层组件与选型思路,开发者可按需组合模型、网关与工具。

9月3日周四
  1. Google DeepMind65

    Google DeepMind 发布 WeatherNext 3,全球天气 AI 模型分辨率提升至 5 公里并实现每小时更新

    Google DeepMind 发布 WeatherNext 3,改用实时卫星观测数据直接训练全球天气 AI 模型。模型以 5 公里分辨率、每小时更新生成预报,降水预报 CRPS 最高较 IMERG 提升 60%,并已集成至 Search、Gemini、Maps 及 Google Cloud 平台。

    推荐理由:WeatherNext 3 摒弃传统数值天气预报训练数据,改为直接使用实时卫星观测数据,将全球分辨率提升至5公里并实现每小时更新,降水预报CRPS最高改善60%。

  2. Hugging Face Blog61

    NeoMME高效多模态原生多语言编码器

    NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。

    推荐理由:单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。

  3. GitHub Engineering69

    GitHub Copilot 四项优化降低 AI 编码成本且不牺牲任务质量

    GitHub Engineering 公布 GitHub Copilot 的四项成本优化:选择性压缩重复输出、移除文件读取行号前缀、缩短任务工具提示词、批量送达后台完成结果。离线基准与在线实验显示平均成本下降约 2.3%–5%,无质量回归;强调应按完整任务而非单次工具调用评估效率。

    推荐理由:GitHub Copilot 通过四项工程优化降低 AI 编码成本,读者可据此理解上下文压缩与提示精简的边界。

9月1日周二
  1. Hugging Face Blog64

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核库支持浏览器端本地 AI 推理

    Hugging Face 发布 @huggingface/kernels 库及 Fleet 众测工具,提供 207 个 WebGPU 内核,覆盖矩阵乘法、Softmax、LayerNormalization 等操作。

    推荐理由:Hugging Face发布207个WebGPU内核库,以版本化包形式提供可复用的GPU操作原语,并搭配Fleet众测平台收集真实硬件性能证据,为浏览器端本地AI推理奠定底层基础。