论文

扩散模型中文本到图像对齐的对齐引导分数匹配

Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models

模型训练监督微调与指令调优

摘要

扩散模型可生成高度逼真的图像,但通常难以实现精确的文本-图像对齐。虽然最近的 后训练 方法使用外部奖励或人类偏好信号来改善对齐,但它们的性能在很大程度上取决于奖励质量,并且不直接解决扩散过程本身内的对齐问题。最近的无奖励方法(例如 SoftREPA)证明,通过对比学习优化软文本标记可以有效改善文本-图像表示对齐,优于标准参数高效 微调 基线。然而,对比公式可能会过度惩罚负对,这表现为典型的失败案例,例如过度计数和重复。为了解决这个问题,我们提出了一种轻量级、无奖励的 后训练 方法,该方法通过将对比对齐指导直接集成到扩散模型的分数匹配目标中来细化软词元。通过在分数级别分配对齐方向,我们的方法减轻了这些限制,并产生更加连贯和语义忠实的生成。实验表明,我们的方法与 SoftREPA 相匹配,同时大幅改善了其故障情况,在 GenEval 基准上的计数准确性提高了 35% 以上。我们的方法无缝适用于现有的扩散主干(SD1.5、SDXL 和 SD3),并且是对现有基于 RL 的扩散 后训练 方法的补充。项目页面:https://jaayeon.github.io/AGSM