论文

阐明用于自由形式交错文本图像生成的统一多模态模型

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

模型训练预训练

摘要

能够生成文本和图像的生成式人工智能模型的进步标志着多模态智能领域向前迈出了关键一步,特别是对于涉及两种模态交织的任务。为了将这种智能推进到下一阶段,模型自主生成自由形式的交错文本图像序列至关重要。在本文中,我们介绍了 ILLUME-X,这是一种先进的统一多模态范式,它通过提高多模态数据效率和稳定多模态训练过程来实现高质量、自由形式的交错文本图像生成。 ILLUME-X 包含三个关键组件:(i)针对交错文本图像生成而优化的扩展训练数据管道,(ii)针对自由长度多模态标记序列的具有自适应目标的渐进训练策略,以及(iii)针对交错文本图像序列的客观综合评估方法 ILScore。值得注意的是,我们的 ILLUME-X 在多个交错的文本图像生成任务(如风格转换、图像分解和讲故事)上优于以前的统一模型。