论文

Meta-CoT:增强图像编辑的粒度和通用性

Meta-CoT: Enhancing Granularity and Generalization in Image Editing

模型训练监督微调与指令调优

摘要

统一的多模态理解/生成模型通过将细粒度的理解纳入其思想链 (CoT) 流程,显示出改进的图像编辑性能。然而,一个关键问题仍未得到充分探索:什么形式的 CoT 和训练策略可以共同增强理解粒度和泛化能力?为了解决这个问题,我们提出了 Meta-CoT,这是一种对任何单图像编辑操作执行两级分解的范例,具有两个关键属性:(1)可分解性。我们观察到任何编辑意图都可以表示为一个三元组——(任务、目标、所需的理解能力)。受此启发,Meta-CoT 对编辑任务和目标进行分解,生成特定于任务的 CoT,并遍历所有目标上的编辑操作。这种分解增强了模型对编辑操作的理解粒度,并引导其在训练过程中学习三元组的每个元素,从而大幅提高了编辑能力。 (2)普遍性。在第二个分解级别中,我们进一步将编辑任务分解为五个基本元任务。我们发现,对这五个元任务以及三元组的其他两个元素进行训练足以在不同的、看不见的编辑任务中实现强泛化。为了进一步使模型的编辑行为与其 CoT 推理保持一致,我们引入了 CoT 编辑一致性奖励,它鼓励在编辑过程中更准确、更有效地利用 CoT 信息。实验表明,我们的方法在 21 个编辑任务中实现了 15.8% 的总体改进,并且当仅在一小部分元任务上进行训练时,可以有效地推广到未见过的编辑任务。我们的代码、基准测试和模型发布于 https://shiyi-zh0408.github.io/projectpages/Meta-CoT/