论文

ParetoSlider:用于连续奖励控制的扩散模型 后训练

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

模型训练强化学习

摘要

强化学习 (RL) 后训练 已成为根据人类偏好调整生成模型的标准,但大多数方法依赖于单一标量奖励。当多个标准很重要时,“早期分级化”的普遍做法会将奖励压缩为固定的加权总和。这使得模型在训练时处于单一权衡点,无法对固有冲突的目标提供推理时间控制——例如图像编辑中的即时遵守与源保真度。我们引入了 ParetoSlider,这是一个多目标 RL (MORL) 框架,它训练单个扩散模型来逼近整个 Pareto 前沿。通过使用不断变化的偏好权重作为调节信号来训练模型,我们使用户能够在推理时进行最佳权衡,而无需重新训练或维护多个检查点。我们通过三个最先进的流匹配主干来评估 ParetoSlider:SD3.5、FluxKontext 和 LTX-2。我们的单一偏好条件模型匹配或超过了为固定奖励权衡而单独训练的基线的性能,同时独特地提供了对竞争生成目标的细粒度控制。