论文

GazeME:用可学习标记提升文生图目标显著性

Amplify What You Gaze At: Target Saliency Boosting in Text-to-Image Generation

模型推理解码与生成控制

摘要

文本到图像的生成在控制对象出现的内容、位置和方式方面取得了进步,但视觉注意力如何在对象之间分配仍然很大程度上未被探索。在本文中,我们介绍了目标显着性增强,这是一项新任务,旨在在文本到图像生成过程中增强特定对象的视觉显着性,而不需要任何视觉先验。我们的主要见解是,视觉显着性本质上是相对的:提高目标对象的显着性还取决于场景中所有对象的全局显着性分布。基于这一见解,我们提出了 GazeME,这是一个轻量级框架,它使用显着标记提示,在对象描述周围插入可学习的标记标记,以指示在视觉上强调或抑制哪些对象。为了学习这些标记,我们构建了一个显着性语义数据集,将图像提示对中的对象与对象级显着性分数相关联,并提出显着性先验标记激活(SPMA),这是一种显着性感知随机标记激活策略,利用相对显着性关系进行稳健训练。在推理过程中,GazeME会自动在提示中插入适当的标记,从而直接增强目标对象的视觉显着性。大量实验表明,GazeME 可以有效提高目标显着性,同时保持语义对齐和图像质量。

GazeME的捷径分析,比较目标大小、位置及图像外观等因素。
图4(图注摘要):GazeME的捷径分析,比较目标大小、位置及图像外观等因素。