论文

一旦中毒,任意控制:VLM 中的可编程后门

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

模型评测安全与风险评测

摘要

现有的视觉语言模型 (VLM) 后门通常被视为静态漏洞:一对一和 N 对 N 攻击在受害者训练之前将一个或多个触发器绑定到一组有限的目标。这种假设大大低估了威胁。我们证明,单个中毒阶段可以将可编程后门植入 VLM,允许攻击者在推理时选择以前未见过的目标字幕语义,并根据需要合成相应的隐秘触发器。与固定映射攻击不同,所提出的任意到任意字幕控制范例将 后训练 目标选择与中毒解耦,从而无需重新训练 VLM 即可动态控制目标字幕。我们的方法有两个组成部分。首先,启发式中毒策略将模型暴露给不同的触发标题对,鼓励它学习一般的触发即指令规则,而不是记住特定的后门模式。其次,特征空间触发隐写术方法将攻击者指定的任何目标标题映射到隐秘的视觉触发器,以规范控制的扰动或非语义补丁的形式实现。一旦插入到任意图像中,这些触发器就会导致中毒的 VLM 生成在语义上与所选目标标题对齐的输出,即使目标在中毒期间看不见。大量实验表明,我们的攻击实现了任意字幕控制的高成功率,保留了干净的模型实用性,并且在几种经典后门防御下仍然有效。