NVIDIA Developer · AI· Tanya Lenz·· 21 天前AI 评分32
何时使用 Encode-Prefill-Decode 拆分加速多模态模型推理
When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving
AI 导读
Encode-prefill-decode(EPD)拆分是一种多模态模型推理优化技术,将视觉编码器阶段与 prefill 和 decode 阶段分离。该技术在图像密集型提示、短到中等长度输出以及量化 MoE 模型上效果最显著。结合 NVIDIA Dynamo 可实现最高 5 倍加速。
来源:NVIDIA Developer · AI · developer.nvidia.com