论文

针对大型视觉语言模型中压缩触发的隐形故障的特征感知词元攻击

Feature-Aware Token Attack for Compression-Triggered Stealthy Failures in Large Vision-Language Models

模型评测安全与风险评测

摘要

视觉词元压缩提高了大型视觉语言模型的效率,但可能会暴露完整词元评估遗漏的故障。我们研究的对抗性图像保留了完整的正确性,但在压缩后会产生错误,即使两个推理路径都在干净的图像上成功。造成此类失败具有挑战性,因为扰乱词元重要性还会损害全词元推理所需的视觉内容。我们提出了特征感知词元攻击(FATA),它将注意力抑制与对一组固定的显着干净图像词元的基于余弦的特征保留相结合。在主要的 LLaVA-1.5-7B 设置中,FATA 仅使用视觉编码器梯度,无法访问已部署的压缩器、词元预算或下游任务。在受控重建协议下,在四个视觉相关任务子集和四个压缩器中,FATA 实现了 SR = 96.3% 全词元准确率保留和 CBR = 22.1% 条件盲法,而 CAA 为 89.8% 和 15.7%。消融支持平衡压缩路径故障与完整词元保存的两个目标的作用。在三个评估检测器的四次攻击中,FATA 的检测率也是最低的,误报率为 5%。这些发现促使我们联合评估全词元和压缩推理的对抗鲁棒性。