论文

内嵌评论家引导图像编辑

Inline Critic Steers Image Editing

模型推理解码与生成控制

摘要

基于指令的图像编辑不仅在不同情况下而且在图像区域之间都表现出异构困难,从而激发了将校正分配给模型困难的地方的细化方法。在完全生成图像或完成去噪步骤之后,现有的细化信号到达较晚。我们询问这样的信号是否可以在正在进行的前向传递中起作用。为了研究这个问题,我们探测了一个冻结的图像编辑模型,发现虽然生成能力仅在最后几层中出现,但错误模式已经在早期层中设置(与最终层错误图的等级相关 \r{ho} = 0.83)。基于此,我们引入了 Inline Critic,这是一种可学习的标记,它批评冻结模型在其中间层的预测,并引导其隐藏状态以在前向传递期间改进生成。提出了一个三阶段的方法来稳定从学习如何批评到指导生成的训练。结果,我们在 GEdit-Bench 上取得了最先进的成绩(7.89),在同一骨干网的 RISEBench 上取得了 +9.4 的增益,在 KRIS-Bench 上取得了最强的开源结果(81.92,超越了 GPT-4o)。我们进一步提供的分析表明,批评者真正塑造了模型的注意力和后续层的预测更新。