论文
前沿T2I偏好+量规奖励后训练
Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards
摘要
近年文生图模型视觉质量显著进步,但通过后训练继续改进仍很困难,因为没有任何单一奖励信号能捕捉人类偏好的全部范围。我们为开放域文生图开发了一个简单有效的后训练配方,基于互补奖励信号的组合。奖励系统含两部分:在大规模人类偏好数据上以Bradley-Terry目标训练的偏好奖励,捕捉整体审美与感知偏好;以及显式评估提示忠实度等属性、并提供抗奖励黑客保障的量规奖励。关键挑战是如何组合异构奖励。我们证明朴素加权平均导致次优优化行为,并提出更有效平衡偏好优化与量规满足的奖励组合策略。在Arena文生图排行榜上,RL训练的Flux2dev比基座高69个Elo分,后训练的Ideogram-4超越排行榜上所有开源模型,达到1223.5 Elo(SOTA主张基于2026年9月4日排行榜快照)。结果表明前沿生成模型训练的有效奖励需要覆盖用户意图的广度与优化下的抗利用性。为支持复现研究,我们发布Arena-T2I-Training——能恢复部分全规模训练增益的1K训练数据子集。项目页:https://arena.ai/。