论文
ELDiff:当证据学习遇到文本到图像扩散时
ELDiff: When Evidential Learning Meets Text-to-Image Diffusion
摘要
在多对象文本到图像(T2I)扩散中,确保文本提示和生成的视觉内容之间的语义一致性对于图像合成至关重要。然而,这种一致性约束在扩散模型的去噪过程中往往被低估。尽管词元监督扩散模型可以通过学习图像内容和对象分割图之间的对象一致性来缓解这个问题,但它往往会遇到分割图偏差和语义重叠冲突的问题,特别是在涉及多个对象时。在本文中,我们提出了 ELDiff,一种新的证据学习监督 T2I 扩散模型,它利用不确定性度量和冲突检测的优点来增强不可靠分割图的容错性并抑制语义冲突,从而加强对象方面的一致性学习。具体来说,提出了像素证据损失,通过证据正则化来抑制对不可靠标签的过度自信,而词元冲突损失则旨在通过优化测量的冲突因子来削弱语义之间的矛盾。大量实验表明,我们的 ELDiff 在 SD v1.4、SD v2.1、SDXL、SD v3.5 和 Qwen-Image 上优于现有的基于训练和基于免训练的 T2I 扩散模型,且无需额外的推理时间操作。值得注意的是,ELDiff 可以无缝扩展到 T2I 扩散模型的现有训练管道。代码可以在 https://github.com/QingtaoPan/ELDiff 找到。