arXiv · Artificial Intelligence· Zhaolong Su, Yujin Han, Feng Wang, Jameson Dong, Hins Hu, Difan Zou·· 6 小时前精选AI 评分60
CoRe:协同演化奖励模型以缓解视频扩散模型中的潜在奖励欺骗
CoRe: Co-Evolving Reward Models for Mitigating Latent Reward Hacking in Video Diffusion Models
AI 导读
论文提出 CoRe 框架,通过让奖励模型与生成器共同演化来缓解视频扩散模型中的潜在奖励欺骗问题。固定潜在奖励会在数百次更新后导致分布逃逸,使奖励分数与感知和运动质量脱钩;CoRe 在生成器当前样本上持续重训练奖励模型并锚定真实视频偏好,在 Wan2.1-T2V-1.3B 上相比预训练模型和先前对齐方法持续提升生成质量,并避免固定奖励优化的质量崩溃。
推荐理由
固定奖励信号会让视频生成模型在潜在空间偏离数据分布,CoRe 通过奖励模型与生成器共同演化来缓解这一问题,为视频扩散模型的对齐提供了可迁移的动态训练视角。
来源:arXiv · Artificial Intelligence · arxiv.org