论文
CoBind:用于 无需训练 文本到图像生成的阶段感知组合绑定
CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation
摘要
基于扩散的文本到图像模型通常无法处理涉及多个实体、属性和关系的复杂提示,从而产生对象遗漏、不正确的属性分配或反转的空间布局。现有的 无需训练 方法主要加强 词元级 注意力,但没有明确建模哪些属性属于哪些实体,或者在去噪过程中何时应强制执行不同的约束。我们引入了 \textbf{CoBind},一个用于阶段感知组合绑定的 无需训练 框架。 CoBind 将提示解析为实体、属性和关系的组合图。它首先使用实体完整性和关系约束建立全局布局,然后通过对比跨实体优化将属性绑定到目标实体。在后续的去噪步骤中,结构指导逐渐放松,以保留纹理和视觉细节。 CoBind 还根据当前每个约束的满足程度来调整引导强度,减少不必要的潜在更新。 CoBind 不需要重新训练或附加注释。 T2I-CompBench++、GenEval 和多重扩散主干上的实验表明,属性绑定、空间关系和复杂合成生成方面得到了持续改进,同时保持了有竞争力的视觉质量。