EditCaption:用于图像编辑指令合成的人工改进的 SFT 和 HAE-DPO
EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis
摘要
具有精确编辑指令的高质量源-目标图像对对于指令引导的图像编辑至关重要,但大规模构建此类训练三元组仍然成本高昂。最近的流程通常依赖于视觉语言模型来自动合成编辑指令,但我们发现强大的 VLM 仍然难以描述图像对之间的视觉转换。特别是,它们表现出三种反复出现的故障模式:方向不一致、视角模糊和缺少细粒度属性。在对 400 个图像对进行的人工评估中,多个开源 VLM 基线产生的严重错误率超过 47%,使得许多合成指令不适合下游训练。为了解决这个问题,我们提出了 EditCaption,这是一个用于图像编辑指令合成的两级 后训练 管道。首先,我们通过基于 GLM 的自动字幕、EditScore 过滤和人工细化构建了 100K 监督 微调 数据集。其次,我们收集 10K 个人工注释的偏好对,其中每个被拒绝的指令都标有其主要错误类型和严重性。基于该数据集,我们提出了硬度自适应错误感知 DPO (HAE-DPO),这是一种任务自适应 DPO 目标,它引入了基于人类标记的严重性、故障模式类型和参考模型硬度的自适应裕度。三个基准测试的实验表明,我们采用 SFT+HAE-DPO 的 235B 模型在开源和封闭模型中实现了最先进的性能,在 Eval-400 上得分为 4.720,在 HQ-Edit 上得分为 4.672,在 ByteMorph-Bench 上得分为 4.651,在这三个方面均超过了 Gemini-3-Pro。人工评估确认关键错误率从 47.75% 下降到 17.50%,正确率从 41.75% 提高到 70.25%,超过 Gemini-3-Pro (66.00%)。