Omni-Diffusion-Distill:统一多模态扩散大语言模型的少步蒸馏
Omni-Diffusion-Distill: Few-Step Distillation of Unified Multimodal Diffusion Large Language Models
摘要
统一多模态扩散大语言模型 (dLLM) 为图像生成和多模态理解提供了单一架构,但其迭代解码需要数十到数百次前向传递。现有的几步蒸馏方法主要集中在图像生成或文本生成上,因此不清楚如何将完全离散的多模态 dLLM 压缩为单个高效的学生,同时保留生成和理解。我们引入了 Omni-Diffusion-Distill,这是一个统一的两阶段蒸馏框架,它保留了强大的生成和理解能力,同时大大降低了统一多模态 dLLM 的推理成本。 Omni-Diffusion-Distill 在离散标记空间中协调图像和文本的生成和理解的蒸馏。在第一阶段,学生被训练通过重播缓存的教师轨迹来跳过解码步骤,在第二阶段,学生沿着其自己的推出在中间状态上进行细化。我们进一步纠正了统一蒸馏中的两个降解源 具有减少并行文本解码下重复的成对碰撞惩罚,以及防止因在图像生成中拟合锐化教师分布而导致的熵崩溃的熵匹配指导。 Omni-Diffusion-Distill 在多模态 dLLM 的解码效率与生成和理解性能之间实现了最先进的权衡,将图像生成从 128 个解码步骤减少到 8 个,将多模态理解从 512 个减少到 64 个,从而实现 18.2 倍和 21.2 倍的挂钟加速。在这些预算下,它在文本到图像生成方面在 GenEval 上得分为 0.828,在 DPG-Bench 上得分为 83.0,而在多模态理解方面,它在 MM-Vet 上达到了 20.0 分,在 COCO 字幕上达到了 57.2 分(在相同步骤中是教师 28.4 分的两倍)。