跳到正文
热点事件持续更新

MoE预训练专家耦合减少All-to-All通信

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月8日,arXiv Computation and Language 发表一项MoE预训练研究(一手报道),提出相关专家放置与token洗牌两种方法,用于降低all-to-all通信开销;两种方法不改变路由决策和专家参数。研究发现,预训练早期路由器已学会以相关模式分配token,在top-2设置下,0.8%的专家对被42%的token共同选中。目前报道仅披露上述方法与统计结果,未涉及实验基准、训练规模或后续验证进展。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · Computation and Language
    MoE 预训练中的专家耦合:用相关放置与 token 洗牌降低 all-to-all 开销

    一项 MoE 预训练研究提出相关专家放置与 token 洗牌两种方法,在不改变路由决策和专家参数的前提下降低 all-to-all 通信开销。研究发现预训练早期路由器已学会以相关模式分配 token,top-2 下 0.8% 的专家对被 42% 的 token 共同选中。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。