论文

面向组合生成的相关性加权多奖励优化

Correlation-Weighted Multi-Reward Optimization for Compositional Generation

模型训练强化学习

摘要

文本到图像模型生成的图像与自然语言提示非常吻合,但构图生成长期以来一直是一个核心挑战。模型通常很难在一个提示中满足多个概念,经常会忽略一些概念并导致部分成功。这种失败凸显了在奖励优化过程中联合优化多个概念的难度,其中竞争的概念可能会相互干扰。为了解决这个限制,我们提出了相关加权多奖励优化(\ours),该框架利用概念奖励之间的相关结构来自适应地对优化中的每个属性概念进行加权。通过考虑概念之间的相互作用,我们平衡了竞争性奖励信号,并强调了部分满足但在样本中生成不一致的概念,从而改善了组合生成。具体来说,我们将多概念提示分解为预定义的概念组(例如,对象、属性和关系),并从每个概念的专用奖励模型中获取奖励信号。然后,我们自适应地重新加权这些奖励,使用基于相关性的难度估计为冲突或难以满足的概念分配更高的权重。通过将优化重点放在每个组中最具挑战性的概念上,我们鼓励模型同时一致地满足所有要求的属性。我们应用我们的方法来训练最先进的扩散模型 SD3.5 和 FLUX.1-dev,并在具有挑战性的多概念基准测试(包括 ConceptMix、GenEval 2 和 T2I-CompBench)上展示出一致的改进。

面向组合生成的相关性加权多奖励优化:论文配图
图 1:基于相关性的重新加权的动机。多概念构图生成通常会产生分布在生成的图像中的不同部分成功。因此,天真地汇总每个概念的奖励往往会关注在图像中一致满足的概念,而无法突出更困难的概念。相关性计算生成的实例之间的概念交互,以识别困难的概念,然后在标准化优势重新加权期间为这些概念分配更高的权重(即 Q3、Q4 和 Q5)。