论文

诊断和纠正多模态扩散中的概念遗漏 Transformer

Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers

模型推理解码与生成控制

摘要

多模态扩散 Transformer (MM-DiTs) 在文本到图像的生成方面取得了显着的进展,但它们经常遭受概念遗漏,即指定的对象或属性无法出现在生成的图像中。通过对文本标记执行线性探测,我们证明文本嵌入可以区分代表目标概念不存在的特征“遗漏信号”。利用这种洞察力,我们提出了遗漏信号干预(OSI),它放大遗漏信号以主动催化缺失概念的生成。在 FLUX.1-Dev 和 SD3.5-Medium 上的综合实验表明,即使在极端场景下,OSI 也能显着减少概念遗漏。