论文

Qwen-Image-2.0-RL技术报告

Qwen-Image-2.0-RL Technical Report

模型训练强化学习

摘要

我们提出了 Qwen-Image-2.0-RL,这是一个 后训练 管道,它应用来自人类反馈 (RLHF) 的强化学习和 同策略 蒸馏 (OPD) 来提高 Qwen-Image-2.0 扩散模型的视觉质量和指令跟踪能力。为了提供可靠的奖励信号,我们通过 微调 视觉语言模型构建了特定于任务的复合奖励模型,并具有逐点评分范式和思维链推理。对于文本到图像的生成,奖励模型涵盖对齐、美观和肖像保真度维度。对于图像编辑任务,奖励系统解决指令遵循的准确性和面部身份保存问题。在此奖励系统的基础上,我们开发了一个可扩展的基于 GRPO 的 RL 训练框架,结合了混合无分类器指导 (CFG) 策略来保留预先训练的知识,通过组内奖励范围过滤进行提示管理,以及按类别奖励权重校准。为了合并 T2I 和编辑的任务专用 RL 策略,我们提出 同策略 蒸馏 作为最终训练阶段,它通过轨迹级速度匹配将多个教师合并为一个学生模型。广泛的评估表明,Qwen-Image-2.0-RL 在 Qwen-Image-Bench 上获得了 57.84 的总分(比基础模型高出 2.61),在文本到图像领域的 Elo 评级为 1193(+78),在图像编辑领域的 Elo 评级为 1349(+93),这表明在美观质量、及时坚持和编辑准确性方面取得了一致的进步。