FullFlow:升级文本到图像流匹配模型以实现双向视觉-语言生成
FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation
摘要
现代文本到图像的扩散模型编码丰富的视觉先验,但仅通过单向文本条件生成来暴露它们。现有的统一视觉-语言模型通过大规模联合预训练或对文本路径的大量再训练来恢复双向能力,在文本到图像主干已经编码之前丢弃强图像。我们引入了 \emph{FullFlow},这是一种参数高效的方法,通过仅训练 LoRA 适配器和轻量级文本头,将预训练的整流流文本到图像模型升级为双向视觉语言生成器。 FullFlow 使图像保持其本机连续流,并添加离散的文本插入过程。单独的图像和文本时间步将推理转化为二维生成空间中的轨迹选择,从而支持使用单个主干进行文本$\rightarrow$image、image$\rightarrow$text、联合采样和部分文本预测。在稳定扩散 3 (SD3) 上,在相同的可训练参数计数和匹配的 LoRA 等级下,FullFlow 将 text$\rightarrow$image FID 从 $62.7$ 提高到 $31.6$,将 image$\rightarrow$text CIDEr 从 $2.0$ 提高到 $99.4$,与 LoRA 等效项相比,遵循之前的 SOTA 公式(双扩散),在匹配的挂钟训练时间,同时将峰值 VRAM 从${\sim}84$\,GB 到 ${\sim}38$\,GB,并在 24 小时内将两个 RTX A5000 GPU 上的吞吐量提高 ${\sim}8\times$,仅训练 ${\sim}5\%$ 的主干参数。相同的配方转移到 FLUX.1-dev 并通过部分文本生成支持下游 VQA。这些结果表明,无需完整的多模态预训练,就可以从预训练的文本到图像流模型中释放强大的双向视觉-语言能力。