论文
通过区域感知双峰直接偏好优化生成组合文本到图像
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
摘要
尽管文本到图像(T2I)模型取得了快速进展,但生成准确反映复杂合成提示(涵盖属性绑定、对象关系、计数)的图像仍然具有挑战性。为了解决这个问题,我们提出了 BiDPO,一个增强 T2I 模型组合文本到图像生成能力的框架。我们首先引入一个精心设计的管道来构建大规模偏好数据集 BiComp,并进行严格的质量控制。然后,我们扩展 Diffusion DPO 来联合优化图像和文本偏好,这对于改进模型在生成时遵循复杂文本提示非常有效。为了进一步增强细粒度对齐的模型,我们采用区域级指导方法来关注与组合概念相关的区域。实验结果表明,我们的 BiDPO 显着提高了成分保真度,在多个基准测试中始终优于先前的方法。我们的方法强调了基于偏好的 微调 在复杂的文本到图像任务中的潜力,为现有技术提供了灵活且可扩展的替代方案。