论文
用一张纸劫持机器人:VLM控制机器人物理即时注入的系统研究
Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots
摘要
视觉语言模型(VLM)越来越多地被部署为机器人系统中的规划器,它们将自然语言命令转换为基于视觉场景理解的可执行动作。感知和指令遵循之间的紧密耦合引入了新的攻击面:放置在机器人视野内的对抗性文本可以充当间接提示注入到 VLM 推理堆栈中。我们提出了针对 VLM 控制排序的物理提示注入攻击的系统研究,引入了四类分类法、间接标牌、任务重新定义、权限模拟和冲突注入,实例化为 20 个攻击提示的基准,在三个物理场景布局和三个目标特异性和规则明确性不同的命令表述中进行评估。在三种前沿 VLM(GPT-4o、Gemini 2.5 Flash、Qwen3-VL-32B)上进行的 5,670 次试验中,攻击成功率分别为 27.0%、29.4% 和 5.0%,并且权威冒充和否定攻击在所有三种模型中转移。对推理痕迹的分析表明,成功的妥协几乎总是有意识的(99.9% 的确认率),并且模型通过结构上不同的机制进行防御,Gemini 明确拒绝,GPT-4o 感知不注意。我们评估了三种简单的缓解措施:基于提示的防御(75-100%有效,取决于模型)、两阶段验证(85-100%)和预处理文本屏蔽(100%)。我们的研究结果表明,VLM 控制的操纵很容易受到人类可读的物理标牌的影响,并且简单的防御措施可以大大降低风险,尽管防御选择涉及权衡。这些防御措施在我们的基准测试中保留了一般任务能力,但它们可能会损害需要读取场景内标签的任务。