跳到正文
原文
arXiv · Computation and Language· Darshan Thaker, Lachlan Ewen MacDonald, Ren\'e Vidal·· 6 小时前AI 评分34

FastGuide 加速扩散大语言模型的奖励引导解码

FastGuide: Accelerating Reward Guidance for Diffusion Large Language Models

AI 导读

FastGuide 采用并行与自回归混合解码加速扩散语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码快 4.4×,生成质量相近。它每步一次奖励模型反向传播并复用 guidance 生成多个 token,利用 KV cache 和注意力稀疏重计算逐步 unmask token,并对模型不自信的 token 延迟解码。

来源:arXiv · Computation and Language · arxiv.org