跳到正文

#Meta

今日 0 条
9月22日周二
  1. PyTorch Blog69

    vLLM 引入硬件无关层以支持多样化硬件

    vLLM 推出硬件无关(HW agnostic)层,确保项目在推进前沿 GPU 性能工程的同时,继续支持旧 GPU、消费者级 GPU 和树外加速器。新层保持 fullgraph torch.compile 兼容、可扩展、与硬件特定路径隔离,并使用原生 PyTorch 或可移植 DSL 实现。

    推荐理由:vLLM 新增硬件无关层,让关心多硬件和旧 GPU 的用户在不牺牲可移植性的前提下继续使用。

9月2日周三
  1. Meta Engineering · AI80

    Meta 构建组织第二大脑:AI 从专家处学习并持续改进

    Meta 发布一个组织级 AI Agent,通过结构化知识库与可组合食谱分离知识与推理,并借助自改进循环将专家反馈编译为经过回归测试的更新,无需模型重训练。系统包含知识层、推理层、评估框架与改进循环,经过六周三轮开发实现评估时间从天降至分钟、零回归,且每次修正自动强化回归套件。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

8月10日周一
8月4日周二
  1. Meta Engineering · AI71

    Meta GEM 训练:如何将广告推荐基础模型效率在 LLM 规模下翻倍

    Meta 发布 GEM 训练细节,通过定制推荐内核库、混合超低精度训练、拓扑感知 5D 并行与 SM-free 通信等协同设计,将端到端训练效率翻倍至 20–25% MFU,并在 12 个月内将训练 FLOPs 扩展 4 倍。

    推荐理由:Meta 分享了 GEM 在 LLM 规模下训练推荐模型的具体方法,为跨推荐与 LLM 的基础设施协同设计提供可迁移经验。

7月16日周四
7月1日周三
2月25日周三
  1. Meta Engineering · AI72

    Meta 开源 RCCLX:面向 AMD 平台的 GPU 通信增强库

    Meta 开源 RCCLX(基于 RCCL 的增强版),集成 Torchcomms 并将 CTran 移植到 AMD 平台,支持 AllToAllvDynamic 等特性。新增 Direct Data Access 与低精度集合通信,在 MI300X 上解码小消息延迟降低 10–50%,前向计算加速 10–30%,端到端推理延迟下降约 9–10%、吞吐提升约 7%,GSM8K 偏差约 0.3%。

    推荐理由:原文给出 AMD 平台通信库的能力变化与量化结果,读者可据此评估 RCCLX 对现有训练与推理工作流的实际影响。

2月6日周五
  1. Together AI71

    LLM 在无提示约束下会生成什么:近无约束生成行为研究

    Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。

    推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。

10月18日周六
10月1日周三
9月29日周一