论文

PatchHead:学习空间补丁证据以进行通用人工智能生成的图像检测

PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection

应用与实践结构化分析、预测与决策

摘要

当人工智能生成的图像检测器的训练和测试图像来自不同的生成器或数据集时,其泛化能力很差。尽管 DINO 等视觉基础模型产生了丰富的空间表示,但现有的检测器通常仅使用全局聚合的 CLS 词元对图像进行分类。我们假设将 DINO 特征全局聚合到单个 CLS 词元中会掩盖空间分布的生成痕迹。为了测试这个假设,我们引入了 PatchHead,一个轻量级的空间聚合头,它保留了 DINO 补丁标记的二维组织并整合了相邻区域的证据。在训练过程中,我们冻结预训练的 DINO 主干,仅优化插入的 LoRA 适配器、PatchHead 和辅助投影头。在跨越手动管理和野外设置的九个跨数据集基准测试中,PatchHead 在七个数据集上排名第一,在其余两个数据集上排名第二。它将最强先验方法的平均平衡精度从 91.6% 提高到 94.6%(+3.0 点),并将最坏情况下的精度从 82.4% 提高到 89.4%(+6.9 点),同时仅引入 8.6% 的可训练参数和 0.08% 的额外 FLOP。进一步的定性分析表明,PatchHead (i) 减少了类条件域差异,(ii) 将表示从内容主导的显着性重定向到空间分布的真实性证据。总之,这些观察结果提供了表示级别的解释,说明为什么空间块聚合在生成器和数据集之间传输比单个基于 CLS 的全局表示更可靠。我们的代码和模型将在接受后提供。