论文
让 MLLM 失明:MLLM 内容审核中的对抗性走私攻击
Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation
摘要
多模式 大语言模型 (MLLM) 越来越多地被部署为自动内容审核者。在这种情况下,我们发现了一个严重威胁:对抗性走私攻击。与对抗性扰动(用于错误分类)和对抗性越狱(用于产生有害输出)不同,对抗性走私利用了人类与人工智能的能力差距。它将有害内容编码成人类可读的视觉格式,而人工智能仍然无法读取,从而逃避自动检测并实现有害内容的传播。我们将走私攻击分为两种途径:(1)感知失明,破坏文本识别; (2) 推理封锁,尽管文本识别成功,但仍抑制语义理解。为了评估这种威胁,我们构建了 SmuggleBench,这是第一个包含 1,700 个对抗性走私攻击实例的综合基准测试。 SmuggleBench 的评估表明,专有(例如 GPT-5)和开源(例如 Qwen3-VL)最先进的模型都容易受到这种威胁,攻击成功率 (ASR) 超过 90%。通过从感知和推理的角度分析漏洞,我们确定了三个根本原因:视觉编码器的有限能力、OCR 的鲁棒性差距以及特定领域的对抗性示例的稀缺。我们对缓解策略进行了初步探索,研究了测试时间扩展(通过 CoT)和对抗训练(通过 SFT)来缓解这一威胁的潜力。我们的代码可在 https://github.com/zhihengli-casia/smugglebench 上公开获取。