Apple Machine Learning Research·· 14 天前AI 评分39
DACA-GRPO:扩散语言模型强化学习中的去噪感知信用分配
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
AI 导读
summary_zh: DACA-GRPO 是一种轻量级即插即用的 GRPO 训练增强方法,针对扩散语言模型强化学习中去噪步骤等权处理和均值场似然估计有偏的两大缺陷,引入去噪进度分数与分层掩码似然两个互补机制。
来源:Apple Machine Learning Research · machinelearning.apple.com