论文

SCO:无需训练的图文交错生成自校正

Self-correction Optimization for Interleaved Multimodal Generation

模型推理应用与实践推理验证与自校正解码与生成控制内容创作

摘要

多模态大语言模型(MLLM)在视觉理解和生成方面取得了重大进展。然而,生成交错的图像-文本内容仍然具有挑战性,因为它需要紧密集成的多模式理解和生成能力。尽管现有的 MLLM 提供了有前景的解决方案,但大多数都依赖于增强数据的额外训练,这在计算上成本高昂,并且在保留视觉主题、时间一致性和物理合理性方面仍然受到限制。在这项工作中,我们提出了自校正优化(SCO),这是一种有效的免训练一致交错生成方法。 SCO 将无分类器指导更新作为参考,并在两个互补约束下执行最小的自校正,包括新事件约束和状态保留约束。具体来说,新事件约束促进图像文本序列之间的时间一致性,而状态保留约束在整个后续生成步骤中保持视觉主题的一致性。具有挑战性的交错实验 多模态生成基准证明了时间一致性和视觉主题保存方面的显着改进。此外,SCO 可以扩展到视频生成,并改进物理基础过程的建模,包括机器人操作和长期手工制作。

SCO:无需训练的图文交错生成自校正:论文原图
图 1:自校正优化机制,包括新事件和新事件实现的状态保留约束以及视觉主题一致性。