论文
视觉生成模型的阈值引导优化
Threshold-Guided Optimization for Visual Generative Models
摘要
通常通过成对偏好优化来使大型视觉生成模型与人类反馈保持一致。虽然此类方法在概念上很简单,但它们从根本上依赖于带注释的对,限制了将反馈作为独立标量评级收集的设置中的可扩展性。在这项工作中,我们重新审视 KL 正则化对齐目标,并表明最优策略隐式地将每个样本的奖励与通常难以处理的特定于实例的基线进行比较。我们提出了一个阈值引导的对齐框架,用根据经验分数统计估计的数据驱动的全局阈值取代了这个预言基线。该公式将对齐转换为未配对数据的二元决策任务,从而可以直接根据标量反馈进行有效优化。我们还引入了置信度加权项来强调分数严重偏离阈值的样本,从而提高样本效率。跨越三个测试集和五个奖励模型的扩散和屏蔽生成范式的实验表明,我们的方法比以前的方法持续改进了偏好对齐。这些结果将我们的阈值引导框架定位为一种简单但有原则的替代方案,用于在无需配对比较的情况下对齐视觉生成模型。