跳到正文
原文
arXiv · Computation and Language· Zhihan Yang, Wei Guo, Jean-Marie Lemercier, Simon Welker, Yonggan Fu, Mohammad Mahdi Kamani, Sajad Norouzi, Julius Berner, Tomas Geffner, Karsten Kreis, Yongxin Chen, Molei Tao, John Thickstun, Pavlo Molchanov, Ante Juki\'c, Arash Vahdat, Morteza Mardani·· 16 小时前AI 评分44

Sigma:大规模连续扩散语言模型

Large Language Continuous Diffusion Models

AI 导读

论文提出 Sigma,首个基于可引导低维 ODE/SDE 潜轨迹的大规模(3B/8B)连续扩散语言模型,通过分块似然优化训练,并用自回归模型预训练权重热启动。推理中,分类器无关引导与得分温度对高保真推理和编码至关重要;在 GSM8K、Minerva、HumanEval、MBPP 及 MATH-500、AIME 上与离散模型表现相当。

来源:arXiv · Computation and Language · arxiv.org