arXiv · Computation and Language· Darshan Thaker, Lachlan Ewen MacDonald, Ren\'e Vidal·· 6 小时前AI 评分34
FastGuide 加速扩散大语言模型的奖励引导解码
FastGuide: Accelerating Reward Guidance for Diffusion Large Language Models
AI 导读
FastGuide 采用并行与自回归混合解码加速扩散语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码快 4.4×,生成质量相近。它每步一次奖励模型反向传播并复用 guidance 生成多个 token,利用 KV cache 和注意力稀疏重计算逐步 unmask token,并对模型不自信的 token 延迟解码。
来源:arXiv · Computation and Language · arxiv.org