论文

用离散扩散模型有效强化视觉文本思维

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

模型训练强化学习

摘要

基于强化学习的 后训练 已被广泛采用,以在能够生成文本和图像的统一多模态模型中实现交错的视觉和文本推理。然而,大多数现有方法都是建立在自回归(AR)统一模型的基础上,这需要在视觉推理过程中完整的图像再生。在这项工作中,我们证明多模态离散扩散模型是 AR 模型的有效替代品,可用于交错推理中的强化学习,因为它们能够通过局部视觉编辑而不是完整的图像词元再生来执行有效的视觉展示。与 AR 基线相比,这将 GRPO 期间的采样轨迹计算减少了 26.9%,并且性能下降最小。尽管效率有所提高,但我们发现联合奖励分配(采用跨模态共享奖励信号)会在强化学习更新期间在不相关的图像和文本标记序列之间引入跨模态干扰。为了解决这个问题,我们提出了分解奖励分配,这是一种将奖励独立分配给文本和视觉片段的策略。通过分解奖励分配,我们的 RL 方法比联合奖励分配提高了 11.2%,比基本模型提高了 38.04%。