论文

解开重新耦合:解决主题驱动的文本到图像生成中的相似性-可控性悖论

Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation

模型训练强化学习

摘要

主题驱动的文本到图像 (T2I) 生成旨在在根据文本提示编辑其上下文时保留主题的身份。这项任务的核心挑战是“相似性-可控性悖论”,即增强文本控制通常会降低主题的保真度,反之亦然。我们认为这种悖论源于文本提示的模糊作用,文本提示通常负责描述主题和所需的修改,从而导致模型的信号相互冲突。为了解决这个问题,我们提出了 DisCo,这是一种新颖的框架,它首先分解然后重新耦合视觉和文本信息。首先,我们的文本-视觉解耦模块隔离了信息来源:仅从带有主题实体词的参考图像中提取主题身份,而文本提示则简化为仅包含修改命令,其中主题指的是一般代词,消除了描述性歧义。然而,这种严格的分离可能会导致主题与其背景之间的不自然的组合。我们通过设计专用奖励信号并使用强化学习来无缝地重新耦合视觉定义的主题和文本生成的上下文来解决这个问题。我们的方法有效地解决了这个悖论,实现了同时高保真主题保存和精确的文本控制。大量的实验表明,我们的方法实现了最先进的性能,产生高度逼真和连贯的图像。