论文

文本到图像扩散模型的几何感知偏好优化

Geometry-Aware Preference Optimization for Text-to-Image Diffusion Models

模型训练偏好优化

摘要

偏好对齐已成为文本到图像扩散模型的标准实践。直接偏好优化 (DPO) 通过消除显式奖励建模来简化此过程。其扩散变体 Diffusion-DPO 已成为广泛采用的基线。扩散-DPO 实质上增加了偏好样本的可能性,同时抑制了不偏好样本。在本文中,我们从流形假设的角度重新审视了扩散模型的 DPO 式对齐方法。在这种观点下,自然图像集中在嵌入高维环境空间中的低维流形附近,而 DPO 直接优化整个空间中的偏好分布,而不考虑这种几何结构。这会在优化动态中造成不匹配:它会抑制保留几何形状的切向更新,同时不足以限制危险的法线方向更新。这种不匹配逐渐降低图像质量和多样性。为了解决这个问题,我们提出了各向异性几何感知偏好优化(APO),它用从参考模型导出的几何感知各向异性度量取代了预测误差的统一欧几里德处理。具体来说,APO自适应地在参考去噪函数高度敏感的方向上加强正则化,同时在允许安全语义调整的方向上放松约束。这根据局部流形几何形状重新校准偏好优化,并保持原始流形结构。实验表明,APO 在不同的基准测试中相对于各种现有的对齐方法实现了强大的性能和超过 60% 的平均胜率。与之前的方法相比,它需要的训练步骤明显减少,并且在整个训练中保留了生成多样性。

文本到图像扩散模型的几何感知偏好优化的原论文方法或结果图
图 1:不同方法下流形上的玩具偏好优化。具有 4 层 MLP 噪声预测器的 DDPM 在嵌入 $\mathbb{R}^{32}$ 的单位圆上进行预训练。偏好对是通过从每个半圆中随机采样一个点来构建的,其中右侧的半圆作为获胜者。列表示训练进度,行表示方法。红点表示偏离歧管的样品。 DPO、KTO 和 InPO 在对齐过程中表现出大量的偏离流形漂移,而 APO 仍然紧密地集中在底层流形周围,同时向获胜区域收敛。