论文
上下文图像生成中的视觉语言绑定
Vision-Language Binding in In-Context Image Generation
摘要
上下文图像生成模型(例如 FLUX.2)采用文本提示和可选的参考图像作为输出的视觉条件。在内部,所有三个输入(文本、参考图像和噪声标记)都通过单个注意力流连接和处理,其中所有标记都可以相互关注。这使得参考信息如何流经模型以生成输出图像仍然是未知数。我们表明,文本标记和参考图像之间出现了隐式的跨模式绑定:文本标记在前向传播过程中吸收视觉参考内容,并且吸收的内容会因果影响生成的输出。我们通过 FLUX.2 上的三种因果干预来表达这种绑定:T2I Lens,它通过文本到图像的路径解码中间文本标记激活; Attention Knockout,切断特定的注意力边缘; I2I-to-I2I Patching,在编辑运行之间复制文本词元激活。在对各种图像(包括 SUN397 和 DreamBench++ 数据集以及在线收集的图像)的 2,875 个编辑任务中,我们观察到一致的分工:参考图像的属性(如颜色、样式和场景设置)首先写入文本标记,文本标记将它们携带到生成的图像;像素精确的属性(例如特定的面孔或实例身份)绕过文本标记,并通过图像到图像的注意力直接从参考流到图像。我们进一步将参考文本绑定本地化到文本序列的填充标记。这些结果表明,多模态 DiT 中的文本标记不仅仅是提示符,而且是参考图像内容的结构化通道。更广泛地说,他们认为即使在统一注意力的多模态生成模型中,词元模态也会构建条件信息如何在网络中表示和路由。