论文
FlowInOne:将多模态生成统一为图像输入、图像输出流匹配
FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
摘要
多模态生成长期以来一直由文本驱动的管道主导,其中语言决定视觉,但无法在其中进行推理或创建。我们通过询问是否所有模式(包括文本描述、空间布局和编辑指令)是否可以统一为单个视觉表示来挑战这一范式。我们提出了 FlowInOne,一个框架,它将多模态生成重新表述为纯粹的视觉流,将所有输入转换为视觉提示,并实现由单个流匹配模型控制的干净的图像输入、图像输出管道。这种以视觉为中心的公式自然地消除了跨模式对齐瓶颈、噪声调度和特定于任务的架构分支,在一个连贯的范式下统一了文本到图像的生成、布局引导的编辑和视觉指令。为了支持这一点,我们引入了 VisPrompt-5M,这是一个包含 500 万个视觉提示对的大型数据集,涵盖物理感知力动力学和轨迹预测等各种任务,同时还引入了 VP-Bench,这是一个经过严格策划的基准评估指令 忠实性、空间精度、视觉真实感和内容一致性。大量实验表明,FlowInOne 在所有统一生成任务的开源模型中实现了最先进的性能,同时保持与领先商业系统的竞争力,从而为完全以视觉为中心的生成建模奠定了新的基础,其中感知和创造在统一的连续视觉空间中共存。我们的代码和模型发布在 https://csu-jpg.github.io/FlowInOne.github.io/