论文

幸免:通过对抗性编辑数据进行基于推理的人工智能生成图像检测

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

模型训练强化学习

摘要

检测人工智能生成的图像只是任务的一半:部署的检测器还必须证明其判断的合理性,但现有的检测器从训练数据中继承了三种故障模式:从不同来源收集的真实和虚假图像会产生出处捷径,监督解释语料库教授模板化的基本原理,静态伪造语料库使决策边界保持静止,而生成器不断移动。我们引入\methodname{},一种对抗性强化学习框架,它使两个异构模型相互对抗。扩散图像编辑器学习将真实照片编辑成相同照片的虚假副本,从而愚弄当前检测器,而推理 MLLM 学习通过基于自由形式推理的判断来揭露它们。这两种奖励在设计上都是防捷径的:攻击者只有在忠实执行编辑时才获得奖励,而防御者只有在判决正确时才获得奖励。当两个模型交替时,每一轮的攻击者都会针对当前检测器的盲点重新生成一个更难的训练池,因此检测器必须概括而不是记住任何固定的工件分布。尽管这种解释永远不会得到回报,但由于仅注重准确性的训练的副作用,其质量不断提高。在此循环中训练的检测器在三个外部基准中的每一个上单调改进。