论文

VisualLeakBench:视觉语言代理中可重现的动作边界传播失败

VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents

模型评测安全与风险评测

摘要

视觉语言代理在写入内存、发送消息或调用外部工具之前越来越多地使用屏幕截图、文档和用户界面。我们研究了这种设置中的具体故障模式:动作边界传播,其中敏感或不安全的可见文本从图像复制到下游工具参数中。我们展示了 VisualLeakBench,这是一个涵盖 UI、聊天、文档、表单和仪表板场景的多元化 500 个图像基准测试,并在两个工作流程(笔记捕获和外部切换)下使用四个生产 VLM 系统评估分层的 100 个图像代理子集。基线时,在 78.8% 的 PII 情况和 85.5% 呈现的不安全文本情况下,目标字符串会传播到工具参数中。在防御系统提示下,呈现的不安全文本传播仍然高达 52.6%,而 PII 工具传播则下降至 2.0%,这主要是通过抑制工具使用而不是保留实用性来实现的。速率取决于工具表面:类似搜索的工具会抑制 PII 传播,但呈现的不安全文本仍然会跨越工具边界。我们测量视觉到工具的传播而不是下游指令执行。我们还提供了标记目标预言机上限诊断,可将大多数故障定位在工具边界,同时将响应侧泄漏保留为残余风险。