论文

窃取补丁大小:对抗性地操纵视觉语言模型

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

模型评测安全与风险评测

摘要

我们提出了一种黑盒模型窃取攻击,可以恢复已部署的视觉语言模型(VLM)的私有视觉分词器配置,包括视觉补丁大小和输入预处理管道。关键思想是由 ViT 式补丁化引起的任务级侧通道:当合成网格图像与隐藏补丁网格对齐时,边界线索在标记化时被擦除,导致周期性准确性下降。通过扫描网格单元尺寸并测量这些塌陷,我们推断出补丁尺寸;通过引入填充和一致性检查测试,我们进一步确定预处理是动态分辨率还是固定分辨率,并恢复目标调整大小分辨率。在开源 Qwen-VL 变体和专有模型(包括 GPT 和 Claude)中,我们可靠地恢复与分词器相关的参数。最后,我们表明这种泄漏可以实现预处理感知的传输攻击和针对模型的对抗性操纵。