产品一致性:通过 SFT 和 RL 改进基于指令的图像编辑中的产品身份保护
ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL
摘要
基于指令的图像编辑的最新进展使模型能够根据自然语言指令执行复杂的视觉编辑。然而,在以产品为中心的场景中,保留产品功能、品牌和文本元素至关重要,当前的开源和闭源模型通常难以维护这种细粒度的对象身份。由于缺乏具有文本保真度约束的基于指令的产品图像编辑数据集,这个问题进一步复杂化,使其在很大程度上被视为基于指令的图像编辑模型的隐式功能。在这项工作中,我们引入了 ProductConsistency 数据集,旨在改进以产品为中心的图像编辑。我们的方法包括一个包含 87k 个产品编辑样本的监督 微调 (SFT) 数据集、一个包含 869 张独特产品图像的强化学习 (RL) 数据集,以及一个新的基准数据集 ProductConsistency Benchmark,以允许对编辑模型进行严格和标准化的评估。为了指导强化学习训练,我们提出了一种循环一致性奖励,通过使用原始产品描述和编辑图像生成的图像描述之间的描述相似度来强制产品身份的语义保留。我们使用我们的数据集对 Qwen-Image-Edit-2511 和 Flux.1-Kontext-dev 进行微调,并在 OCR 和感知指标以及基于 MLLM 的评估方面展示了相对于基线模型的一致改进,表明产品一致性、文本渲染和整体视觉质量更强; Qwen-Image-Edit-2511 模型的字符错误率降低了 5 倍。代码和管道可在 https://anonymous.4open.science/r/ProductConsistency-6FCC/README.md 获取