Together AI·· 2026-02-19精选AI 评分62
Consistency Diffusion Language Models:推理加速最高 14 倍且质量不下降
Consistency diffusion language models: Up to 14x faster inference without sacrificing quality
AI 导读
Together AI 提出 CDLM 训练方案,让扩散语言模型在块因果掩码下做多 token 最终化并启用精确块级 KV 缓存。实验显示 CDLM–Dream 在 GSM8K-CoT 与 MBPP-Instruct 上分别提速 11.2x 与 14.5x,多数任务精度变化很小。
推荐理由
通过训练让扩散语言模型在块内自回归解码并启用精确 KV 缓存,在保持质量的同时显著减少推理步数与延迟。
来源:Together AI · together.ai