论文

DARS:面向指令式图像编辑的带结构化推理双层信用分配强化学习

DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing

模型训练强化学习

摘要

指令式图像编辑采用规划器-渲染器流水线:视觉语言模型(VLM)先把指令转换为编辑计划,再由扩散模型执行该计划。仅用最终图像奖励训练这类系统效率低下,因为一次糟糕的编辑无法揭示进一步的优化应更多归因于规划器还是渲染器,而且即使是规划器主导的情形,也难以在自由形式的推理轨迹中定位问题。我们提出 DARS,一个面向这一两阶段设置的双层信用分配强化学习框架。在模块层面,多计划多渲染 rollout 估计计划间与计划内的奖励变异性,用于软模块路由;rollout 平均奖励提供难度估计,用于自适应课程。在规划器内部,四字段结构化推理输出实现了前缀门控奖励与token级优势重加权,把结果级反馈转化为局部化监督。在五个基准上的实验表明,在相同主干、数据、奖励模型和 rollout 预算下,DARS 优于 Joint RL 基线,且在推理密集型编辑上增益最大。

DARS:面向指令式图像编辑的带结构化推理双层信用分配强化学习:论文配图
图1. 两个视觉上不佳的编辑结果可能需要截然相反的跨模块更新侧重。案例A:规划器较好地捕捉了所请求的编辑,但渲染器未能将其实现,因此该样本应把更多纠正性更新权重放在渲染器上。案例B:采样得到的计划对该指令而言是较无用的中间产物,而渲染器忠实执行了它,因此该样本应把更多纠正性更新权重放在规划器上。DARS旨在通过路由信号区分以渲染器为主与以规划器为主的更新需求;当需要侧重规划器一侧时,其结构化槽位支持规划器内部更细粒度的诊断。预告图展示两阶段图像编辑流程中两个低分失败案例,它们需要相反的跨模块信用分配决策:一个应侧重渲染器纠正,另一个应侧重规划器纠正。