论文

具有噪声跟踪对的整流流的离线偏好优化

Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs

模型训练偏好优化

摘要

文本到图像模型的现有偏好数据集通常仅存储最终的获胜者/失败者图像。这种表示对于整流流(RF)模型来说是不够的,其生成自然地由特定的先验噪声样本索引,并遵循几乎笔直的去噪轨迹。相比之下,先前的扩散模型 DPO 式对齐通常使用独立的前向噪声过程来估计轨迹,这可能与真实的反向动态不匹配并引入不必要的方差。我们提出了先验噪声感知偏好优化(PNAPO),这是一种专门用于整流流的 离策略 对齐框架。 PNAPO 通过保留用于生成每个获胜者/失败者图像的配对先验噪声来增强偏好数据,将标准(提示、获胜者、失败者)三元组转变为六元组。利用 RF 的直线特性,我们通过噪声图像插值来估计中间状态,这限制了轨迹估计空间并为偏好优化产生了更严格的代理目标。此外,我们引入了一种动态正则化策略,该策略根据 (i) 获胜者和失败者之间的奖励差距和 (ii) 训练进度来调整 DPO 正则化,从而提高稳定性和样本效率。在最先进的 RF T2I 主干上进行的实验表明,PNAPO 持续改进偏好指标,同时大幅减少训练计算量。