论文

超越判决:视觉提示注射护栏的证据一致评估

Beyond the Verdict: Evidence-Aligned Evaluation of Visual Prompt-Injection Guardrails

模型评测基准与评测资源

摘要

仅判决评估并不能揭示视觉语言模型 (VLM) 是否使用了支持其决策的视觉证据。我们在网络代理护栏中研究这个问题,其中 VLM 判断屏幕上的文本是否与用户指令冲突。我们引入了 Mind2Web-Injection,这是一个包含 9,954 个指令-屏幕截图对的基准测试,具有指令相关标签、像素精确的证据框和匹配的图像侧反事实。在六个 VLM 中,平均精度几乎相同的两个模型在证据对齐检测 (EAD)(检测到并正确定位的攻击比例)方面相差九倍。为了测试判决是否取决于作为证据引用的命令,我们将指令替换为认可该命令的指令。 Qwen3-VL-32B 是最强的开放权重定位器,仅在 58.7% 的情况下返回对齐,而 GPT-5.6-luna 则在 99.9% 的情况下返回对齐。为了诊断这些故障,我们提出了两种 无需训练 干预措施。 ReadGate 在不改变判决的情况下改进了基础,而 CmdCompare 则测试显式指令命令比较是否解决了指令端不一致问题。这些结果分别激励报告判决的正确性、证据本地化和反事实响应能力。