论文

中间文本表示引导文本到图像的生成,以增强唯一对齐

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

模型推理解码与生成控制

摘要

文本到图像(T2I)扩散模型通常无法忠实地呈现明确的文本描述,而是由于一种称为概念关联偏差的现象而默认为强学习的视觉先验。我们表明,这种偏见对于唯一(OAO)物体、以单一规范形式存在的实体(例如天体、地标和艺术品)尤其强烈。这些概念根深蒂固的视觉识别往往无法仅通过提示进行修改。为了解决这一挑战,我们首先通过信息理论分析确定,最终的文本嵌入丢弃了中间层文本表示中存在的概念级信息,从而减少了后续去噪过程可用的互信息。然后,我们提出了中间文本表示(IR)引导的扩散,它在早期去噪步骤中将文本编码器的中间隐藏状态注入到调节信号中,恢复被抑制的概念,而无需任何额外的训练、优化或外部模型。为了系统地评估将 OAO 对象的生成输出与异常提示对齐的挑战性任务,我们引入了 OAO-AttackBench,这是一个由与 OAO 对象的核心视觉标识直接冲突的反事实提示组成的基准。对包括 OAO-AttackBench 在内的四个基准的实验表明,我们的方法在保持生成保真度和人类偏好的同时,将 VQAScore 提高了 19.1 个百分点。项目页面:https://soyoun-won.github.io/one-and-only-ir-guidance/。