Vector Institute· Nathan Lalonde·· 2026-07-23AI 评分33
Mixture-of-Experts:从稀疏路由到多模态部署
Mixture-of-Experts: From sparse routing to multimodal deployment
AI 导读
MoE 模型通过路由器为每个 token 动态选择少量专家子网络激活,在增加总参数的同时保持每 token 计算稀疏。文章首先解释路由决策、负载均衡与训练中 specialization 的形成机制,随后报告了在 4 张 A100 GPU 上微调 350 亿参数多模态 MoE 的经验,涵盖 5 种失败的 sharding 方案、最终成功的方法,以及按层路由审计揭示的音频、视频与文本容量分配。
来源:Vector Institute · vectorinstitute.ai