Skip to content
arXiv · Machine Learning Theory· Xin Teng, Muxiao Li, Hongyi Wen·· 4 hr agoAI score31

分布鲁棒 Mixture-of-Experts 训练

Distributionally Robust Mixture-of-Experts Training

AI brief

研究者提出 Distributionally Robust MoE Training(DRMoET),把逐层专家视为内生鲁棒组,优化高损失路由结果而非仅均衡流量。

Source: arXiv · Machine Learning Theory · arxiv.org