论文
DARS:面向指令式图像编辑的带结构化推理双层信用分配强化学习
DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing
摘要
指令式图像编辑采用规划器-渲染器流水线:视觉语言模型(VLM)先把指令转换为编辑计划,再由扩散模型执行该计划。仅用最终图像奖励训练这类系统效率低下,因为一次糟糕的编辑无法揭示进一步的优化应更多归因于规划器还是渲染器,而且即使是规划器主导的情形,也难以在自由形式的推理轨迹中定位问题。我们提出 DARS,一个面向这一两阶段设置的双层信用分配强化学习框架。在模块层面,多计划多渲染 rollout 估计计划间与计划内的奖励变异性,用于软模块路由;rollout 平均奖励提供难度估计,用于自适应课程。在规划器内部,四字段结构化推理输出实现了前缀门控奖励与token级优势重加权,把结果级反馈转化为局部化监督。在五个基准上的实验表明,在相同主干、数据、奖励模型和 rollout 预算下,DARS 优于 Joint RL 基线,且在推理密集型编辑上增益最大。
