热点事件持续更新
MoE预训练专家耦合减少All-to-All通信
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月8日,arXiv Computation and Language 发表一项MoE预训练研究(一手报道),提出相关专家放置与token洗牌两种方法,用于降低all-to-all通信开销;两种方法不改变路由决策和专家参数。研究发现,预训练早期路由器已学会以相关模式分配token,在top-2设置下,0.8%的专家对被42%的token共同选中。目前报道仅披露上述方法与统计结果,未涉及实验基准、训练规模或后续验证进展。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
2026-10-08研究提出相关专家放置与token洗牌,降低MoE预训练all-to-all开销。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · Computation and LanguageMoE 预训练中的专家耦合:用相关放置与 token 洗牌降低 all-to-all 开销
一项 MoE 预训练研究提出相关专家放置与 token 洗牌两种方法,在不改变路由决策和专家参数的前提下降低 all-to-all 通信开销。研究发现预训练早期路由器已学会以相关模式分配 token,top-2 下 0.8% 的专家对被 42% 的 token 共同选中。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。