跳到正文
原文
NVIDIA Developer · AI· Elizabeth Goodman·· 15 天前AI 评分20

Dense vs. MoE 模型:活跃参数、吞吐量及选择指南

Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each

AI 导读

NVIDIA 文章对比 Dense 与 MoE 架构,以 Nemotron 3.5 Lightning 为例说明 MoE 如何让 30B 参数模型每 token 仅激活 3B 参数。MoE 通过按 token 选择参数子集,在保持大模型容量的同时提升吞吐量。文中给出两种架构的活跃参数与吞吐量对比,帮助开发者在不同场景下选择合适的模型结构。

来源:NVIDIA Developer · AI · developer.nvidia.com