论文
UC-VLM:使用视觉语言大型模型进行人工智能生成图像检测的一致性驱动学习
UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models
摘要
视觉语言大型模型 (VLLM) 在人工智能生成图像 (AIGI) 检测方面很有前景,因为它们可以产生预测和自然语言输出。然而,大多数现有的基于 VLLM 的检测器主要对语言方面进行微调,而对底层视觉取证线索的关注有限。它们通常还依赖于手动制作的提示或人工注释的基本原理,这限制了可扩展性。我们提出了 UC-VLM,这是一种仅依赖于二进制监督的 AIGI 检测的统一多阶段框架。 UC-VLM 首先自动识别有效的指令变体。然后,它在多阶段训练框架中重复使用相同的二进制标签:(i)增强对非语义取证线索的敏感性的视觉辨别目标,以及(ii)使用二进制标签监督文本输出的标签条件生成目标。这种设计将弱二元监督转变为视觉通路和语言输出的共享监督信号。我们的关键新颖之处是一个统一的多阶段二进制监督框架,它始终重复使用相同的真实性标签进行视觉适应和标签条件文本生成,同时利用自动优化的指令来降低提示敏感性,而不需要人工编写的理由或手工制作的提示。实验表明,UC-VLM 在 GenImage 上实现了 96.1% 的平均准确率,超过了最强的先验结果 4.6%,并在 Chameleon 上获得了 69.6% / 77.9% 的准确率ProGAN / SDV1.4 训练,分别超越最佳基线 11.2% / 15.3%。