跳到正文
原文
arXiv · Computer Vision· Yuanhao Ban, I-Hung Hsu, Anastasios Angelopoulos, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh·· 16 小时前AI 评分42

通过组合偏好与准则奖励后训练前沿文生图模型

Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards

AI 导读

研究者提出一种面向开放域文生图的后训练方案,将偏好奖励与基于准则的奖励组合,以兼顾人类审美偏好、提示词忠实性并抑制奖励破解。RL 训练后的 Flux2dev 在 Arena 文生图榜上 Elo 较基础模型高 69 分,后训练的 Ideogram-4 达到 Elo 1223.5,超过榜单所有开源模型(截至 2026 年 9 月 4 日快照)。

来源:arXiv · Computer Vision · arxiv.org