论文

在推理时将图像引导注入文本条件扩散模型

Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference

模型推理解码与生成控制

摘要

像稳定扩散这样的文本到图像扩散模型可以从文本生成高质量图像,但缺乏一种在推理时注入视觉指导(例如草图、样式)而无需重新训练的方法。现有方法要么需要计算成本高昂的 微调,要么依赖风格转换技术,这种技术存在语义与文本提示不一致的风险。我们引入了视觉概念融合(VCF),这是第一种在推理时对图像和文本提示提供双重调节的方法,无需任何特定于概念的训练。 VCF 通过将 CLIP 图像特征与文本嵌入空间对齐,实现将视觉概念注入到稳定扩散中。 VCF 由三个组件组成:(1) 一个轻量级对齐器,使用 InfoNCE 和交叉注意重建损失将图像标记映射到文本嵌入流形;(2) 保留文本和视觉语义的融合策略;(3) 用于测试时细化的可选提示噪声优化 (PNO) 模块。我们的实验表明,VCF 成功地从参考图像中转移了视觉属性,包括风格、构图和调色板,同时保持了及时的依从性。定量结果显示文本对齐(CLIP 分数)和视觉对应(LPIPS)之间存在权衡,VCF 在参考保真度方面优于基线。