论文

现代 VLM 中强像素级图像篡改检测的简单域概括

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

模型评测鲁棒性、公平性与可信度评测

摘要

现代视觉语言模型(VLM)显着提高了图像生成和编辑能力,使得像素级图像篡改检测变得越来越重要,但在跨模型和分布外变化的情况下也具有挑战性。这项工作研究了现代 VLM(如 ChatGPT、Gemini、Qwen-Image 等)中像素级图像篡改检测的域泛化,旨在学习在不同的 VLM 生成的操作分布中保持稳健的篡改定位模型。我们提出了一个基于两种实用策略的简单而有效的领域通用训练框架。首先,我们引入了一种平衡的小批量采样方案,该方案策略性地对每个小批量中的篡改图像和真实图像进行采样,防止对被操纵的伪影或干净图像先验进行有偏差的优化,并避免训练崩溃,确保每个优化步骤接收到正确的采样梯度信号。其次,我们采用简单的后期注入策略,其中检测器首先在大规模基础数据上进行训练,直到稳定收敛,然后暴露于来自新兴 VLM 分布的少量新选择的支持数据,从而提高适应性,而不会过度拟合有限的新领域。这些组件共同提供了一个简单而强大的方法,用于改进现代 VLM 中的像素级篡改定位和 OOD 鲁棒性。尽管概念简单,但我们的框架在 GPT-Images-2.0、Gemini-3.1、FLUX.2 和 Seedream 4.5 的 OOD VLM 中,平均 gIoU 和 cIoU 的相对改进分别大幅优于先前最先进的 PIXAR,分别为 26.1% 和 26.8%。我们的代码可在 https://github.com/VILA-Lab/PIXAR-DG 获取