离散平均生成器加速扩散语言模型
先了解这件事
2026-10-01 arXiv·Statistics Machine Learning 发表两篇相关一手论文。其一提出离散平均生成器(Discrete Average Generator),作为 MeanFlow 到连续时间马尔可夫链(CTMC)的扩展,在 OpenWebText 上 8–64 步采样实现 16 倍加速并达到最低生成困惑度,Potts 模型模拟中 K 步采样器总变差距离最多降低 67%。其二提出 Simplex-DMD 与 Reinforce-DMD 两种分布匹配蒸馏方法,在 OpenWebText 上对 1,024 token 序列实验,Simplex-DMD 在 4 NFEs 下困惑度 45.6、熵 5.44 nats,相比最强扩散基线降低 49%;Reinforce-DMD 在 256 NFEs 下困惑度 14.9、熵 5.00 nats,降低 20%。两篇论文均聚焦加速扩散语言模型,但方法与指标不同。
AI 根据报道生成 · 1 小时前更新
事件进展
- 10月1日 12:00 · 1 篇报道Distribution Matching Distillation for Continuous DiffusionarXiv · Statistics Machine Learning:连续扩散语言模型的分布匹配蒸馏方法
- 10月1日 12:00 · 1 篇报道Discrete Average Generator加速扩散语言模型arXiv · Statistics Machine Learning:通过离散平均生成器加速扩散语言模型
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv · Statistics Machine Learning连续扩散语言模型的分布匹配蒸馏方法
论文提出 Simplex-DMD 与 Reinforce-DMD 两种分布匹配蒸馏方法,在 OpenWebText 上对 1,024 token 序列进行实验。Simplex-DMD 在 4 NFEs 下达到生成困惑度 45.6、单字熵 5.44 nats,相比最强扩散基线降低 49%;Reinforce-DMD 在 256 NFEs 下达到困惑度 14.9、熵 5.00 nats,降低 20%。
- arXiv · Statistics Machine Learning通过离散平均生成器加速扩散语言模型
论文提出离散平均生成器(Discrete Average Generator),作为 MeanFlow 到连续时间马尔可夫链(CTMC)的扩展。在 OpenWebText 上,该方法在 8 到 64 步采样中实现 16 倍加速并达到最低生成困惑度;在 Potts 模型模拟中,K 步采样器的总变差距离最多降低 67%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。