论文

现成的视觉模型有利于图像操作定位

Off-the-shelf Vision Models Benefit Image Manipulation Localization

模型训练参数高效训练

摘要

由于操作特定特征和语义特征之间存在根本差异,图像操作定位(IML)和一般视觉任务通常被视为两个独立的研究方向。然而,在本文中,我们通过引入一个新的视角来弥合这一差距:这两个方向本质上是相关的,并且一般语义先验可以使 IML 受益。基于这一见解,我们提出了一种新颖的可训练适配器(名为 ReVi),它将现有的现成通用视觉模型(例如图像生成和分割网络)重新用于 IML。受稳健主成分分析的启发,该适配器将语义冗余与这些模型中嵌入的操作特定信息分开,并有选择地增强后者。与需要大量模型重新设计和全面重新训练的现有 IML 方法不同,我们的方法依赖于具有冻结参数的现成视觉模型,并且仅对所提出的适配器进行微调。实验结果证明了我们方法的优越性,展示了可扩展 IML 框架的潜力。