跳到正文
原文
arXiv · Machine Learning Theory· Xin Teng, Muxiao Li, Hongyi Wen·· 3 小时前AI 评分31

分布鲁棒 Mixture-of-Experts 训练

Distributionally Robust Mixture-of-Experts Training

AI 导读

研究者提出 Distributionally Robust MoE Training(DRMoET),把逐层专家视为内生鲁棒组,优化高损失路由结果而非仅均衡流量。

来源:arXiv · Machine Learning Theory · arxiv.org