论文
句子中的图像:统一视觉生成的缩放交错指令
Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
摘要
虽然多模态语言模型的最新进展已经能够从富有表现力的多图像指令生成图像,但现有方法很难在复杂的交错指令下保持性能。这种限制源于当前范式中图像和文本的结构分离,这迫使模型弥合困难的远程依赖关系,以将描述与视觉目标相匹配。为了应对这些挑战,我们提出了 \texttt{I}images i\texttt{N} \texttt{SE}n\texttt{T}ences (\textit{a.k.a}, INSET),这是一种统一的生成模型,可以将图像作为本地词汇无缝嵌入到文本指令中。通过将视觉特征直接定位在其相应的语义槽中,INSET 利用 Transformer 的上下文局部性进行精确的对象绑定,有效地将图像视为密集的、富有表现力的语言标记。此外,我们引入了一个可扩展的数据引擎,它利用 VLM 和 LLM 来构建丰富的长范围序列,从标准图像和视频数据集中合成 1500 万个高质量交错样本。 InterleaveBench 的评估结果表明,INSET 在多图像一致性和文本对齐方面显着优于最先进的方法,并且随着输入复杂性的增加,性能差距不断扩大。除了标准生成之外,我们的方法本质上扩展到多模式图像编辑,将视觉内容集成为指令的一部分,以促进高度表现力和创造性的视觉操作。