论文
针对基于 VLM 的 AI 生成图像检测的印刷攻击
Typographic Attack Against VLM-based AI-generated Image Detection
摘要
视觉语言模型 (VLM) 越来越多地用于人工智能生成图像 (AIGI) 检测,为真实性判断提供自然语言解释。然而,他们解释图像中文本的能力也可能使这些判断暴露于误导性的语义线索。我们系统地评估面向检测、开放权重和商业 VLM 的印刷攻击策略,同时考虑真假攻击和假真攻击。我们的结果表明,推理模式通常比直接模式表现出更大的脆弱性,并且攻击有效性表现出明显的方向不对称性。此外,较大的模型往往表现出更高的干净检测精度,但攻击成功率也更高。我们进一步检查图像和文本转换下的攻击鲁棒性,并研究指示正确类别的覆盖是否有助于纠错。这些分析共同描述了印刷攻击如何影响真实性判断,并暴露了当前基于 VLM 的 AIGI 检测系统的局限性。