论文
释放视觉语言模型的潜力,用于通用人工智能生成的图像检测
Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection
摘要
最近的工作表明,对现代视觉基础模型 (VFM) 的冻结表示进行简单的线性探针可以实现最先进的 AIGI 检测性能,在具有挑战性的野外场景中大大优于专用检测器。这一发现将 DINOv3 确立为后续改进的主要基础模型基线。然而,我们发现视觉语言模型感知编码器(PE)在 AIGI 检测方面具有更大的潜力,因为它的语言对齐表示保留了高级来源语义。具体来说,PE 在其冻结特征空间中表现出比 DINOv3 更强的本地起源组织。然而,语义无关的线性探测无法利用这种结构,因为 PE-Linear 在 In-the-Wild 上的表现仍然比 DINOv3-Linear 低 4.1%。基于这一观察,我们提出了语义原型校准(SPC),它根据取证语义信息构建类别原型,并用监督数据对其进行校准。我们将 SPC 应用于 PE,并将所得检测器称为 PE-SPC。我们的分析表明,这种简单的设计实现了更强的泛化性。在跨生成器、后处理和野外基准测试中,PE-SPC 超越了之前的 DINOv3 基准,并取得了新的最先进结果。