论文
提问、解决、生成:通过自我一致性奖励自我进化统一多模式理解和生成
Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards
摘要
大多数支持视觉理解和图像生成的统一大型多模态模型 (LMM) 仍然依赖于策划的 后训练 监督,例如人工注释、偏好标签或外部奖励模型。我们询问统一的 LMM 是否可以仅使用未标记的图像自主地提高这两种能力。我们提出了一个自我进化的训练框架,具有三个内部角色:生成视觉问题的提议者、回答和评估问题的求解器以及合成图像的生成器。训练仅使用自衍生的一致性信号,没有人工注释、偏好标签或任务训练的外部奖励/判断模型。为了稳定学习,我们引入了求解器词元熵(STE),这是一种基于 词元级 预测不确定性的连续难度信号,即使样本级一致性变得不可靠,它仍然有用。对于图像生成,我们设计了一种多尺度内部评估方案,将问答保真度评分与循环一致的字幕相结合。这创建了求解器介导的耦合,更好的视觉理解可以实现更可靠的生成评估和更强的内部训练信号。该框架在基于扩散的 BLIP3o、整流流 BAGEL 和自回归 VARGPT-v1.1 架构中保留了相同的角色分解、奖励逻辑和训练计划,仅需要每个骨干网的本机提示和生成接口。在八个理解指标中,我们的方法不断改进相应的基本模型。在 BAGEL 上,它在 MMMU 上实现了 $+3.5\%$ 绝对增益,并将 GenEval 图像生成性能从 $82\%$ 提高到 $85\%$。代码和模型是公开发布的。