论文

先勾勒后着色:面向扩散多模态大语言模型的分层强化学习

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

模型训练强化学习

摘要

扩散多模态大语言模型(dMLLM)在图像生成方面能力强大,但通过强化学习(RL)优化它们仍是一大挑战。一个主要困难是同一张图像可以通过许多不同的去掩码序列生成,这使得重要性比率的计算往往难以处理。此外,现有方法往往忽略dMLLM的层级化生成过程:早期词元定义全局布局,后期词元聚焦局部细节。由于给所有词元分配统一奖励,这些现有方法无法反映每个词元对最终图像的实际贡献。为解决这些问题,我们提出分层词元GRPO(Hierarchical Token GRPO,HT-GRPO),将该层级结构直接融入策略优化过程。我们的方法采用先勾勒后着色(Sketch-Then-Paint)训练方案,把更新组织为全局、结构和精修三个不同阶段。我们还使用提示条件化的估计器,从全掩码状态开始计算重要性比率。此外,我们引入分层贡献归因机制,优先处理关键结构词元以确保奖励准确传播。在MMaDA和Lumina-DiMOO两个流行dMLLM骨干上的实验表明,HT-GRPO在GenEval和DPG基准上取得显著增益。跨六个附加指标的评估证实,图像质量、美学与人类偏好均有显著提升。

先勾勒后着色:面向扩散多模态大语言模型的分层强化学习:论文配图
图1:dMLLM的RL内循环策略对比:先勾稿后上色的分层强化学习路线与各基线差异。