论文

锚定和转向扩散:增强推理时文本到图像生成的 忠实性

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time

模型推理解码与生成控制

摘要

虽然文本到图像的扩散模型实现了令人印象深刻的视觉质量,但它们经常难以与复杂的构图提示保持精确对齐。一种有效的策略是改进扩散模型的推理过程,从而更好地利用其预训练的先验来解决错位问题。现有的无需训练方法可以分为两类。第一类侧重于改进随机采样的初始噪声,要么对噪声池执行昂贵的搜索,要么在不确保可靠的语义注入的情况下操纵采样的噪声。第二类侧重于改善去噪轨迹,缺乏及时诊断和纠正语义错误的明确机制。我们提出了 \textbf{AnchorSteer},一个 无需训练 框架,它对 \textbf{初始化} 和 \textbf{去噪轨迹} 进行细粒度控制。 AnchorSteer 由两个协同组件组成:\textbf{语义锚定} 通过基于 CLIP 的先验提取和新颖的潜在先验分数 蒸馏 采样 (LP-SDS) 目标,用文本对齐初始化替换无信息的高斯噪声。具体来说,LP-SDS 将 CLIP 视觉先验提炼为扩散模型的知识分布,从而缩小基于 CLIP 的先验和基于扩散的先验之间的领域差距。 \textbf{反射转向} 通过主动思考-擦除-修饰循环来转变被动降噪,从而实现中期自我校正。它利用基于 VLM 的诊断来检测语义偏差,并执行有针对性的潜在细化以抑制错误内容并恢复丢失的属性。 GenEval 和 T2I-CompBench++ 上的大量实验表明,AnchorSteer 在文本-图像对齐方面始终优于现有基线,同时保持高视觉质量。