论文

ORCA:改善文生图属性绑定与空间关系的组合对齐

ORCA: Hunting Compositional Failures in Text-to-Image Diffusion

模型训练模型推理应用与实践预训练推理策略与问题分解内容创作

摘要

文本到图像的扩散模型在构图提示上会失败:属性绑定到错误的对象,空间关系反转,多对象场景失去计数。最近的架构已经用 T5 编码器增强了 CLIP,正是因为 CLIP 的对比嵌入失去了组合结构,但这些失败仍然存在。因此,我们认为绑定问题不是丢失信息,而是信息错位:文本编码器保留了组合结构,但在由语言建模而不是视觉塑造的表示空间中,并且去噪目标并不直接奖励两者的对齐。我们证明这种对应关系可以作为显式训练信号提供,相关的跨模态信息集中在自监督视觉特征的低秩子空间中,并且提供它可以作为单个辅助损失折叠到扩散训练中。我们的方法 ORCA(正交残差组合对齐)将扩散变换器的潜在特征与源自冻结视觉编码器的低阶目标对齐, 通过预测器,其正交基由 T5 和 CLIP 嵌入之间学习的残差参数化,该预测器为选择视觉读出子空间提供依赖于提示的信号。我们证明,在给定等级下可恢复的跨模态信息受到顶部组件中视觉编码器协方差的谱质量的限制。在三个扩散Transformer主干(DiT-B/2、DiT-L/2、U-ViT-L)中,ORCA 以零推理时间成本在 vanilla 和 REPA 基线上改进了 FID 和 GenEval;在 DiT-L/2 上,它在 200K 步时达到 FID 16.65 和 GenEval 0.291,以一半的训练成本超过最强的 400K 基线,最大的增益集中在属性绑定、空间关系和多对象提示上。

ORCA:改善文生图属性绑定与空间关系的组合对齐:论文原图
图 1:ORCA 通过根据 T5−CLIP 残差构建的文本调节投影仪 K⁡(Δy)K(\Delta y) 将扩散潜伏与低阶视觉目标对齐。在 DiT-L/2 上,ORCA 以 4.8×\mathbf{4.8}{\times} 和 3.6×\mathbf{3.6}{\times} 更少的步骤达到普通 400K400\text{K} FID 和 GenEval,且推理开销为零。