论文
CrACK:协作视觉基础模型中跨模型一致性的对抗性攻击
CrACK: Adversarial Attacks on Cross-Model Consistency in Collaborative Vision Foundation Models
摘要
集成了 CLIP、SAM 和 DINO 等 Vision Foundation 模型的 无需训练 协作管道实现了强大的开放词汇密集预测,并越来越多地部署在安全关键型应用中。通常认为这些系统的安全性取决于其各自模型的稳健性。我们挑战这个假设。我们发现了每个协作管道共有的一个漏洞:每个模型都消耗另一个模型的中间输出,而不验证语义一致性,这是一个未经验证的前提,我们将其称为语义空间对齐依赖。现有的对抗性攻击针对单个模型并忽略了这一前提,使模型间接口完全不受保护。我们提出了 CrACK(跨模型对抗一致性攻击),这是一种推理时间攻击,利用此接口,无需修改任何输入像素、模型权重或训练数据。 CrACK 分两个阶段运行:对抗性亲和力矛盾注入通过在 CLIP 补丁级语义的指导下反转 SAM 编码器特征来破坏跨模式亲和力矩阵,语义界面中毒通过从 CLIP 文本嵌入派生的最大距离标签排列来引导预测。在八个基准测试的四个协作管道上进行的实验表明,CrACK 会导致灾难性的退化,而每个单独的模型都会继续产生其不变的独立输出,从而使每个模型的防御在结构上变得盲目。这种损坏进一步蔓延到大型视觉语言模型推理中,驱动 LLaVA 等模型从视觉完整的输入中产生错误的响应。我们的结果表明,协作人工智能系统的安全性不能降低为其组件的鲁棒性,并且模型间特征接口必须被视为一流的安全边界。