论文
GMO-E$^2$DIT:电子商务图像的基于视觉定位的多操作编辑
GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images
摘要
现实世界的电子商务图像编辑通常需要多次、本地化和可审核的操作,而不是全局重新设计。这种组合性质带来了双重挑战:模型必须精确地将所有请求的编辑应用到正确的区域,同时保留未修改的内容,即使在不明确的指令下也是如此。现有的一次性编辑器将意图解析、空间定位和合成合并为一个步骤,经常导致部分执行失败,这对于商业场景来说是不可接受的。为了解决这个问题,我们引入了 GMO-E$^2$DIT,这是一种代理编辑框架,它将视觉语言模型(VLM)与掩模条件图像编辑器结合起来,以解决结构化多轮任务完成问题。给定未指定的指令,VLM 代理构建基于区域的编辑议程,有效地将认知推理与生成渲染分离。然后,该框架通过操作感知掩码和引用执行子程序,利用反射驱动循环来检查中间结果并确定后续状态。这种迭代机制可靠地保留安全的部分进度、重试未完成的操作并从错误中恢复。此外,我们开发了一个统一的数据管道,为规划、执行和反思提供一致的监督,以及指令驱动评估的综合基准 EComEditBench。大量实验表明,与强大的闭源模型相比,GMO-E$^2$DIT 实现了具有竞争力的性能,与现有基线相比,具有卓越的指令准确性和编辑保真度。