论文
如果您正在等待一个标志...那可能不是!减轻视觉语言代理系统上的视觉注入造成的信任边界混乱
If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems
摘要
由大型视觉语言模型 (LVLM) 提供支持的嵌入式视觉语言代理系统 (VLAS) 的最新进展使人工智能系统能够感知和推理现实世界的场景。在此背景下,交通信号灯等环境信号是重要的带内信号,可以而且应该影响代理的行为。然而,类似的信号也可以被设计为误导性的视觉注入,凌驾于用户意图之上并带来安全风险。这种二元性带来了一个根本性的挑战:智能体必须对合法的环境线索做出反应,同时对误导性的线索保持稳健。我们将这种张力称为信任边界混乱。为了研究这种行为,我们设计了一个双意图数据集和评估框架,通过它我们表明当前基于 LVLM 的代理无法可靠地平衡这种权衡,要么忽略有用的信号,要么遵循有害的信号。我们在基于结构和基于噪声的视觉注入下系统地评估了跨多个具体设置的 7 种 LVLM 代理。为了解决这些漏洞,我们提出了一个多代理防御框架,将感知与决策分开,以动态评估视觉输入的可靠性。我们的方法显着减少了误导行为,同时保留了正确的响应,并在对抗性扰动下提供了稳健性保证。评估框架和工件的代码可在 https://anonymous.4open.science/r/Visual-Prompt-Inject 上获取。