论文

DDA-Thinker:用于推理驱动图像编辑的解耦双原子强化学习

DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing

模型训练奖励建模与过程监督

摘要

最近的图像编辑模型已经实现了很强的视觉保真度,但常常难以完成需要复杂推理的任务。为了研究和增强图像编辑的推理规划,我们提出了 DDA-Thinker,这是一个以 Thinker 为中心的框架,旨在通过固定的生成模型(Editor)独立优化规划模块(Thinker)。这种解耦的以思考者为中心的范例有助于对规划模块进行受控分析,并使其在固定编辑器下的贡献更容易评估。为了有效地指导这个思考者,我们引入了双原子强化学习框架。该框架将反馈分解为通过可验证清单实施的两个不同的原子奖励:直接评估思考者可执行计划的质量的认知原子奖励,该计划作为思考者推理的可操作结果,以及评估最终图像质量的视觉原子奖励。为了提高清单质量,我们的清单合成不仅基于源图像和用户指令,还基于理想后期编辑场景的合理参考描述。为了支持这种训练,我们进一步开发了一个两阶段的数据管理管道,首先合成一个多样化且以推理为中心的数据集,然后应用难度意识细化来策划有效的强化学习训练课程。对推理驱动的图像编辑基准(包括 RISE-Bench 和 KRIS-Bench)的大量实验表明,我们的方法大大提高了整体性能。我们的方法使社区模型能够获得与强大的专有模型竞争的结果,突出了在固定编辑器设置下以思考者为中心的优化的实际潜力。