论文
壁画:通过 Mixture-of-Transformer 将 LLM 知识转移到图像生成
Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers
摘要
利用大语言模型(LLM)进行文本到图像(T2I)合成的能力是一个重要的研究方向。在这项工作中,我们研究了当仅在标准文本-图像对上进行训练时,冻结 LLM 的知识是否可以在 T2I 生成中有效利用。我们通过 Mixture-of-Transformer (MoT) 架构中的共享注意力,将冻结的、具有推理能力的 LLM 与基于扩散的图像生成器集成。我们的实验跨越两个关键问题:(1)在 T2I 训练期间 LLM 的内在知识在多大程度上仍然可以访问,以及(2)最终系统中出现了哪些新功能。在既定基准中,我们的模型在统一理解生成系统中实现了出色的性能:仅使用文本图像数据,在 GenEval 上的推理时间推理为 0.85,在 DPG-Bench 上为 86.75,在 WISE 上为 0.66。值得注意的是,我们发现了训练数据中缺少的紧急行为,包括跨语言图像生成、颜色引导合成、表情符号/ASCII 场景构建以及由世界知识指导的生成。这些结果表明,预训练的 LLM 知识可以在标准文本到图像训练范例下指导图像合成,而无需交错的多模态信号或显式推理监督。我们的研究结果为在资源受限的多模式学习中利用冻结模型功能开辟了新途径。