论文
EditTransfer++:实现忠实、高效的视觉提示引导图像编辑
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
摘要
视觉提示引导的编辑传输旨在直接从示例对中学习图像转换,提供比纯粹文本驱动的方法更精确、更可控的编辑。然而,由于任务和主干之间的结构不匹配,现有的基于 Transformer 的扩散方法通常无法忠实地再现所演示的编辑,包括对文本条件的预训练偏差和采样过程中固有的随机不稳定性。为了弥补这一差距,我们提出了 EditTransfer++,这是一个将渐进式结构化训练与高效调节方案相结合的框架,以提高视觉提示 忠实性 和推理效率。我们首先通过文本解耦训练策略来缓解文本主导,该策略消除了 微调 期间的文本调节,迫使模型仅从视觉证据推断转换,同时仍然支持推理时的可选文本指导。在这个基于视觉的模型之上,最好最差对比细化机制重塑了去噪轨迹,以抑制不忠实的生成并提高随机种子的一致性。为了缓解高分辨率上下文编辑的计算瓶颈,我们进一步引入了条件压缩和重用策略,该策略可减少标记冗余并能够有效生成具有 1024 像素长边缘的图像。对现有基准和拟议的 EditTransfer-Bench 的大量实验表明,EditTransfer++ 实现了最先进的视觉提示 忠实性,其推理速度比以前的方法快得多,这为可扩展的提示引导图像编辑和更广泛的视觉上下文学习提供了一个有前途的方向。