跳到正文

#部署/工程

今日 18 条
7月15日周三
7月14日周二
7月13日周一
7月9日周四
7月8日周三
  1. Hugging Face Blog65

    transformers vLLM 后端达到原生推理速度

    Hugging Face 更新 vLLM 的 transformers 建模后端,在 Qwen3-4B、Qwen3-32B、Qwen3-235B-A22B-FP8 三种模型上达到或超越原生 vLLM 吞吐。模型作者只需添加 --model-impl transformers 标志即可自动获得优化推理,无需手写自定义实现。

    推荐理由:transformers 后端现已达到原生 vLLM 实现同等吞吐,模型作者无需重写代码即可在 vLLM 中获得优化推理性能。

7月7日周二
  1. Berkeley AI Research60

    Intelligence is Free, Now What? Data Systems for, of, and by Agents

    Berkeley EAIR 发表观点文章,探讨当推理成本接近零时数据系统面临的三重挑战:Data Systems For Agents(为智能体推测性查询重新设计,如共享扫描与近似答案)、Data Systems Of Agents(为多智能体集群提供结构化记忆与协调子层)、Data Systems By Agents(由智能体从零合成定制数据系统并验证正确性)。

    推荐理由:原文从推理成本骤降切入,提出数据系统需为智能体重塑的三重挑战,为理解Agent与数据基础设施的共演化提供了一个可迁移的分析框架。

  2. Hugging Face Blog70

    SkyPilot 集成 Hugging Face Storage:零 egress 跨云读取 Hub 数据

    Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,用 hf:// URL 将 HF Bucket 或 Hub repo 挂载到 SkyPilot 任务,实现跨云 GPU 任务零 egress 读取。

    推荐理由:Hugging Face Storage 成为 SkyPilot 官方存储后端,团队可在任意云上运行 GPU 任务并免费读取 Hub 数据,无需跨云拷贝或承担 egress 费用。

  3. Hugging Face Blog82

    LeRobot v0.6.0 发布:Imagine, Evaluate, Improve

    LeRobot v0.6.0 发布,引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新 VLA 模型(GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1)和奖励模型 API(Robometer、TOPReward)。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

7月6日周一
7月4日周六
  1. Lilian Weng77

    Harness Engineering for Self-Improvement

    Lilian Weng 梳理了 harness 工程如何支撑递归自改进(RSI),将 harness 定义为围绕基础模型的运行时系统,负责编排执行、工具调用、上下文管理、状态持久化与结果评估。

    推荐理由:原文系统梳理了 harness 工程的设计模式与优化路径,读者可借此理解自改进循环中非模型层的角色与边界。

7月1日周三
  1. Hugging Face Blog56

    ScarfBench:评测 AI 智能体在企业 Java 框架迁移中的表现

    IBM Research 发布开源基准 ScarfBench,包含 34 个应用、102 套框架实现、204 个迁移任务和约 151K 行代码,覆盖 Spring、Jakarta EE、Quarkus 之间的迁移。当前前沿智能体行为成功率不足 10%,构建成功率显著高于部署和行为验证成功率;智能体普遍高估自身构建结果,且反复回到配置层处理依赖与环境问题。

6月30日周二
6月29日周一
6月25日周四
  1. MIT News · AI62

    MIT 与 Microsoft 提出 Murakkab 系统,提升 AI Agent 工作流的速度与能效

    MIT 和 Microsoft 研究人员开发了 Murakkab 系统,开发者可用自然语言描述意图,系统自动选择模型、工具并动态配置硬件资源。测试显示,该方法在视频问答和代码生成任务中仅用约 35% 的计算量、27% 的能耗和不到 25% 的成本,同时满足性能要求。

    推荐理由:原文给出了具体优化幅度和动态配置方法,读者可以据此评估云上 Agent 工作流的能效潜力。

6月24日周三
6月23日周二
  1. Mistral AI64

    Mistral OCR 4 发布

    Mistral 发布 OCR 4,支持 170 种语言的单容器自托管文档解析,返回边界框、区块分类与内联置信度。

    推荐理由:独立标注者平均 72% 偏好 OCR 4,配合单容器自托管与结构化输出,为企业 RAG 和智能体工作流提供了兼顾数据主权与提取精度的 OCR 方案。

  2. MIT News · AI62

    MIT发布Gleanmer芯片,低功耗实时3D建图助力小型机器人

    MIT研究人员发布名为Gleanmer的系统级芯片,仅消耗约6毫瓦功率即可实时构建详细3D地图,功耗仅为现有最佳建图芯片的2.5%。芯片采用高斯椭球(Gaussian)替代传统体素表示,并结合单遍生成与高斯融合算法,大幅降低内存与功耗,可帮助小型无人机在工业HVAC系统等复杂环境中避障规划路径。

    推荐理由:算法与硬件协同设计让低功耗实时3D建图成为可能,为小型自主机器人和轻量AR设备提供了新的能效路径。

6月19日周五
  1. ScienceDaily · AI40

    SpaceX 计划在太空建造 AI 数据中心,可行吗?

    summary_zh: SpaceX 正探索在轨道建设数据中心,以避开地面土地、水资源和本地电网限制,并利用太空太阳能与近零下 270℃ 的背景辐射散热。太空数据中心面临辐射损坏电子器件、热辐射需要相当于两个足球场面积的散热面、轨道碎片与微流星撞击,以及发射成本和频次等严峻挑战。

6月17日周三
  1. Google Research35

    Google Earth AI 发布 Farmscapes 高分辨率向量化乡村生态地图

    Google Earth AI 发布 Farmscapes 向量化数据集,将英国 130,000 km² 高分辨率卫星影像中的树篱、石墙和林地转为可操作矢量清单。基于 RSF ViT 骨干(预训练于 3 亿+全球卫星图)微调,结合亚米影像与 1 米 LiDAR 双层标注,用 Polsby–Popper 紧凑度得分区分林地(≥30 米直径)、树丛与线性植被。

6月11日周四
  1. Google DeepMind64

    Google DeepMind 发布 DiffusionGemma:4 倍加速的并行扩散文本生成实验模型

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。

    推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。

6月10日周三
  1. Amazon Science76

    AWS EC2 M9g 实例推出经形式化验证的隔离引擎

    AWS 宣布 EC2 M9g 和 M9gd 实例正式可用,首次搭载 Graviton5 处理器并配备 Nitro Isolation Engine。该组件是首个部署在商用云环境的形式化验证 Hypervisor,使用 Isabelle/HOL 完成 33 万行机器检查数学证明,涵盖保密性、完整性、功能正确性、无运行时错误和内存安全。

    推荐理由:给出了可量化的验证规模和语言选择,读者可以据此评估云虚拟机隔离的形式化保障程度。

6月9日周二
  1. Amazon Science47

    Project Eluna:智能体 AI 的物理世界锚定

    2026 年 AI 从"知道"转向"行动",Amazon 推出 Project Eluna,作为仓库运营的智能体模型,通过数字仪表板辅助运营决策。论文提出四种锚定方法:物理引导深度学习、不确定性感知推理、文本到数值桥接,以及第四种方法。UQ4CT 框架在五个基准上保持高准确率,同时将预期校准误差降低 25% 以上。

6月4日周四
  1. Google Research58

    Google开源水文模型框架以提升全球洪水韧性

    Google Research将用于Google Flood Hub的水文模型框架开源至GitHub,采用Apache 2.0许可,基于PyTorch并支持LSTM架构。框架包含2024基准测试版与升级版,新版本在有测站流域将可靠预报期延长6天、无测站流域延长1天,并可与Delft-FEWS平台集成。捷克水文气象研究所(CHMI)已合作验证并提供适配器。

5月29日周五
  1. Together AI78

    Together AI 构建最快语音转文本栈的方法

    Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。

    推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。

5月28日周四
  1. Amazon Science79

    AWS数据中心网络用扁平化架构替代胖树架构

    Amazon Science博客介绍AWS在数据中心部署的首个可扩展扁平网络RNG,采用准随机拓扑和ShuffleBox光互连设备,相比胖树架构减少69%路由器、吞吐提升33%、网络设备能耗降低40%。该网络于2024年底在爱尔兰上线,2026年4月成为AWS全球新建数据中心默认架构。

    推荐理由:提供了可量化的网络性能提升和部署数据,读者可据此评估扁平化架构在云基础设施中的实际收益。

  2. Google Research62

    Google Research 提出零信任聚合实现隐私分析

    Google Research 发布零信任聚合协议,结合格密码学单次提交与可信执行环境证明,用于 Android SafetyCore 等隐私保护场景。新协议允许设备单条消息完成加密聚合,委员会机制辅助解密并注入差分隐私噪声,同时通过 TEE 证明确保协议按公开代码正确执行。

    推荐理由:零信任架构将单次消息加密聚合与TEE证明结合,为大规模隐私分析提供了可验证的多层安全方案。

5月27日周三
  1. Mistral AI42

    Mistral 发布 physics AI:工程加速的基础

    Mistral 发布 physics AI,将工程仿真从数小时/周缩短到秒级单 GPU 前向传播。整合 Emmi AI 作为企业解决方案中新基础能力,合作伙伴包括 ASML、Airbus、Safran 和 Siemens Energy。覆盖产品设计、工装工艺设计和实时数字孪生三大场景,不是替代传统求解器,而是大幅提升设计迭代吞吐量。

5月20日周三
  1. Google Research58

    ERA发表Nature论文并推动计算发现

    Google在Nature发表ERA论文并将其作为工具开放,ERA使用Gemini通过树搜索优化科学代码,在基因组学、公共卫生等六类基准上达到专家级性能。ERA已应用于八个科学问题的研究中,涵盖流行病预测、CO2监测、径流预报、太阳能优化和零售预测,并作为Computational Discovery的核心组件通过Gemini for Science逐步开放。

5月19日周二
  1. Together AI73

    Together AI 发布编码智能体推理基准测试

    Together AI 推出面向编码智能体的规模化推理基准,测试长提示(45k–200k token)、高并发与短输出(平均 450 token)场景下的 TPM、TPS 与 p50 TTFT。

    推荐理由:原文给出了一套高并发长上下文编码智能体的基准测试方法与退化曲线,读者可据此评估自研或商用引擎在真实负载下的 TTFT 与吞吐表现。

5月17日周日