arXiv · Machine Learning Theory· Xin Teng, Muxiao Li, Hongyi Wen·· 3 小时前AI 评分31
分布鲁棒 Mixture-of-Experts 训练
Distributionally Robust Mixture-of-Experts Training
AI 导读
研究者提出 Distributionally Robust MoE Training(DRMoET),把逐层专家视为内生鲁棒组,优化高损失路由结果而非仅均衡流量。
来源:arXiv · Machine Learning Theory · arxiv.org