论文

强化多模态掩蔽扩散模型的生成顺序

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

模型推理解码与生成控制

摘要

扩散语言模型(DLM)最近在自然语言生成任务中取得了实质性进展。最近的研究表明,自适应词元生成顺序可以显着提高数学推理和代码合成应用程序的性能。在这项工作中,我们研究了文本到图像合成和多模态理解的生成顺序的优化。我们首先确定,与数独谜题等语言生成中的结构化问题不同,仅模型 logits 不足以确定文本到图像生成和多模态理解中的最佳生成序列。为了应对这一挑战,我们引入了一个可学习的控制模块,通过组相对策略优化(GRPO)进行训练来确定生成顺序。我们的结果表明,学习这个控制块可以显着提高 DLM 中的文本到图像对齐和多模态理解。特别是,它增强了模型捕获生成图像中细粒度空间关系的能力,同时还增强了多模态推理和理解任务的性能。我们在 GenEval 上评估我们的框架,这是一个以对象为中心的文本到图像对齐基准,它实现了 4.08% 的相对改进。此外,VLMEvalKit 上的实验证实多模态理解相对提高了 4.85%,凸显了我们方法的广泛有效性。