论文
从竞争到合作:基于文本引导的合作无需训练图像编辑
From Competition to Coopetition: Coopetitive Training-Free Image Editing Based on Text Guidance
摘要
文本引导图像编辑是现代多媒体内容创建中的一项关键任务,通过 无需训练 方法取得了显着进展,无需额外优化。尽管最近取得了进展,但现有方法通常受到竞争范式的限制,其中编辑和重建分支由各自的目标独立驱动,以最大限度地与目标和源提示保持一致。由于分支之间缺乏协调,对抗策略会导致语义冲突和不可预测的结果。为了克服这些问题,我们提出了合作性 无需训练 图像编辑(CoEdit),这是一种新颖的零镜头框架,它将注意力控制从竞争转变为合作协商,实现跨空间和时间维度的编辑和谐。在空间上,CoEdit 引入了双熵注意力操纵,它量化分支之间的定向熵相互作用,将注意力控制重新表述为和谐最大化问题,最终改善可编辑和可保留区域的定位。暂时,我们提出了熵潜在细化机制,可以随着时间的推移动态调整潜在表示,最大限度地减少累积的编辑错误并确保整个去噪轨迹中语义转换的一致性。此外,我们提出了保真度约束编辑分数,这是一种联合评估语义编辑和背景保真度的综合指标。对标准基准的大量实验表明,CoEdit 在编辑质量和结构保留方面都实现了卓越的性能,通过实现视觉和文本模式之间更有效的交互来增强多媒体信息的利用率。代码可在 https://github.com/JinhaoShen/CoEdit 获取。