论文
LHSDet:通过视觉问答进行高分辨率人工智能生成的图像检测
LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering
摘要
在扩散模型和自回归模型进步的推动下,人工智能生成的图像的保真度和分辨率现在可以与真实图像相媲美。然而,现有的人工智能生成的图像检测方法通常会对图像进行下采样,不可避免地会忽略高分辨率人工智能生成的图像中关键的底层纹理细节,从而限制了其检测性能。此外,未知生成模型的不断出现使得大规模的预训练数据集变得难以访问。为了应对这些挑战,我们提出了一种新型高分辨率人工智能生成图像检测器,称为 LHSDet。具体来说,我们将人工智能生成的图像检测任务制定为视觉问答问题,利用微调的视觉语言框架来充分利用视觉和文本模态之间的互补信息。认识到现有视觉语言模型的默认视觉编码器不适用于人工智能生成的图像检测,我们重新设计了视觉编码器,以更好地捕获人工智能生成的图像中固有的底层和高层伪影。此外,我们结合了语义级文本分支来实现多模式特征融合和检测。因此,LHSDet 采用三分支架构来提取互补的多模态特征:一个底层视觉分支,聚合局部纹理线索的非重叠补丁;一个基于 SigLIP2 的高层视觉分支,用于全局感知特征提取;以及一个语义级文本分支,使用 BLIP-2 生成字幕。大量的实验结果表明,LHSDet 在不同的生成模型(包括扩散模型和自回归模型)中实现了高检测精度和稳健的性能。