跳到正文
原文
Meta Engineering · AI·· 2025-10-18AI 评分50

Meta 优化 LLM 推理:Tensor Parallelism、Context Parallelism 与 Expert Parallelism 创新

Scaling LLM Inference: Innovations in Tensor Parallelism, Context Parallelism, and Expert Parallelism

AI 导读

Meta 分享了在大语言模型推理中优化资源效率、吞吐量和延迟的并行技术,包括 Tensor Parallelism 的 DDA 算法、Context Parallelism 的 Pass-KV/Pass-Q 变体以及 Expert Parallelism 的 all-to-all 优化。

来源:Meta Engineering · AI · engineering.fb.com