论文

帕累托引导的多奖励协调最优传输

Pareto-Guided Optimal Transport for Multi-Reward Alignment

模型训练偏好优化

摘要

文本到图像生成模型在偏好优化方面取得了显着进展,但在不同奖励模型之间实现稳健的对齐仍然是一个重大挑战。现有的多奖励融合方法依赖于加权求和,调整成本高昂且不足以平衡相互冲突的目标。更重要的是,奖励模型的优化非常容易受到 奖励作弊 的影响,其中奖励分数增加,而生成图像的感知质量却下降。我们证明,在异构奖励上限下针对统一的全局目标进行优化可能会导致 奖励作弊,弱奖励模型固有的不稳定性进一步加剧了这种风险。为了缓解这个问题,我们提出了帕累托前沿引导最优传输(PG-OT)框架。我们的方法构建了一个特定于提示的帕累托前沿,并通过分布感知的最优传输将主导样本映射到它。此外,我们还针对不同的奖励信号特征开发了线上和线下优化策略。为了提供更严格的评估,我们引入了联合支配率(JDR)和联合崩溃率(JCR)作为量化多奖励协同作用和 奖励作弊 的原则指标。实验结果表明,我们的方法优于强大的基线,JDR 提高了 11%,并且在人类评估中实现了接近 80% 的获胜率。