跳到正文
原文
arXiv · Computation and Language· Kaibo Wang, Ding Ding, Fangyu Ding, Zijin Feng, Han Shi, Haili Bai, Jiacheng Sun, Yang Xiang·· 5 小时前AI 评分34

Less Uniform Discrete Diffusion is More Powerful and Scalable

Less Uniform Discrete Diffusion is More Powerful and Scalable

AI 导读

LUDI 是一种新型均匀扩散语言模型(UDLM)框架,通过引入更不均匀的损失函数和逐 token 时间嵌入来解决过均匀训练目标和采样时的条件-目标混淆问题。研究将 7B 自回归模型继续训练为 LUDI-7B,实现每步 3 token 的速度提升,并在少步生成和复杂推理上达到与掩码扩散基线相当的性能。

来源:arXiv · Computation and Language · arxiv.org