论文

HP-Edit:人类偏好的 后训练 图像编辑框架

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

模型训练偏好优化

摘要

常见的图像编辑任务通常采用强大的生成扩散模型作为现实世界内容编辑的领先范例。与此同时,尽管 Diffusion-DPO 和 Flow-GRPO 等强化学习 (RL) 方法进一步提高了生成质量,但由于缺乏针对不同编辑需求定制的可扩展的人类偏好数据集和框架,有效地将人类反馈强化学习 (RLHF) 应用于基于扩散的编辑在很大程度上仍未得到探索。为了填补这一空白,我们提出了 HP-Edit,这是一个用于人类偏好对齐编辑的 后训练 框架,并引入了 RealPref-50K,这是一个跨八个常见任务并平衡常见对象编辑的真实世界数据集。具体来说,HP-Edit 利用少量的人类偏好评分数据和预训练的视觉 大语言模型 (VLM) 来开发 HP-Scorer——一种自动的、与人类偏好一致的评估器。然后,我们使用 HP-Scorer 来高效构建可扩展的偏好数据集,并用作 后训练 编辑模型的奖励函数。我们还引入了 RealPref-Bench,这是一个评估真实编辑性能的基准。大量实验表明,我们的方法显着增强了 Qwen-Image-Edit-2509 等模型,使其输出更符合人类偏好。