跳到正文
原文
Vector Institute· Nathan Lalonde·· 2026-07-23AI 评分33

Mixture-of-Experts:从稀疏路由到多模态部署

Mixture-of-Experts: From sparse routing to multimodal deployment

AI 导读

MoE 模型通过路由器为每个 token 动态选择少量专家子网络激活,在增加总参数的同时保持每 token 计算稀疏。文章首先解释路由决策、负载均衡与训练中 specialization 的形成机制,随后报告了在 4 张 A100 GPU 上微调 350 亿参数多模态 MoE 的经验,涵盖 5 种失败的 sharding 方案、最终成功的方法,以及按层路由审计揭示的音频、视频与文本容量分配。

来源:Vector Institute · vectorinstitute.ai