论文

Golden RPG:用于组合文本到图像生成的置信度自适应区域感知噪声

Golden RPG: Confidence-Adaptive Region-Aware Noise for Compositional Text-to-Image Generation

模型推理解码与生成控制

摘要

组合文本到图像 (T2I) 生成需要一个模型来支持描述不同图像区域的多个子提示。最近的研究表明,扩散模型的\emph{起始噪声}携带着重要的语义信息:从文本预测的“黄金”噪声可以显着提高提示保真度。然而,我们观察到这种噪声预测从根本上来说是全局的:同一网络被要求用单个文本嵌入来总结一个长的、多区域的提示,每当提示描述具有空间分离的实体的场景时,这就会成为瓶颈。我们引入了 \textbf{Golden RPG},一个区域感知噪声预测器,它通过两个可训练的附加功能扩展了冻结的 NPNet:(i)每个区域 \textbf{FiLM 适配器},根据每个子提示重塑预测噪声; (ii) 在 Swin 主干的两个阶段之间注入 \textbf{Region Cross-Attention} 层,允许不同的空间位置关注不同的子提示标记。为了防止区域条件降低提示已经很容易的样本,我们进一步提出了一个 \textbf{Confidence-Adaptive Blending} 头,它动态预测每个样本区域信号应该覆盖全局信号的​​强度。我们对原始 RPG 基准(20 个提示,100 个样本)和 T2I-CompBench 的四个多区域类别(1{,}200 个图像,六种竞争方法)进行评估。 Golden RPG 在每个类别中都获得了最高的跨区域一致性得分,同时在绝对 CLIP-Score 和 CLIP-IQA 上达到了最强的基线。配对用户研究进一步显示,相对于最强基线,$\boldsymbol{\sim}$67\% 的偏好。该适配器包含 $\sim$2M 可训练参数,并且在 SDXL 之上仅添加 $0.6$\,s 的推理开销。