论文

作为漏洞利用的幻觉:携带证据的多模态智能体

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

智能体系统Agent 动作执行与治理

摘要

多模态代理使用屏幕截图、文档和网页来选择工具调用。当错误的视觉声明触发点击、电子邮件、提取或转移时,幻觉会成为授权失败而不是答案质量错误。我们将这种失败模式形式化为幻觉到行动的转换:不受支持的感知主张提供了使特权行动看起来被允许的先决条件。我们提出了携带证据的多模态代理(ECA),它将自由格式的模型文本视为不可接受的证据。 ECA 将每个工具调用分解为关键操作谓词,从受约束的 DOM/OCR/AX 验证器获取类型化证书,并让确定性门仅授予这些证书支持的特权。该架构不隐藏感知错误;它将不透明的模型信念转换为命名验证者、模式和实现残差。验证者红队超过 1,900 次攻击直接暴露了这一残余:四个有针对性的强化步骤将门旁路从 15% 减少到 1.3%。借助内容派生证书,ECA 在 200 个任务的端到端管道(Wilson 95% 上限 2.67%)和 120 个任务的浏览器概念验证(上限 4.3%)上获得了 0% 的不安全操作率。对 500 个分层任务键的直接 HACR 审计表明,对于幼稚代理 (100.0%) 和仅提示防御 (49.6%),不受支持的行动关键型声明会达到不安全执行,但对于 ECA 则不然。 7,488 个 GPT-5.4 基准跟踪上的 Oracle 证书重放可作为门正确性健全性检查,并且神经判断基线在相同威胁模型下仍然可绕过。由此产生的原则很简单:模型语言可以提出行动,但外部证据必须授权它们。

作为漏洞利用的幻觉:携带证据的多模态智能体
图 1:携带证据的多模态代理 (ECA)。单个观察 o ∈ 𝒪 o\!\in\!\mathcal{O} 提供两个严格平行、对称的通道。顶部(不受信任):MLLM 提出一项行动;动作模式 G a G_{a} 声明必须经过认证的谓词。底部(可信):受约束的验证者使用原始观察并发出类型化证书 e = ( τ , v , r , s , ν , κ , t , λ ) e\!=\!(\tau,v,r,s,\nu,\kappa,t,\lambda) 。确定性门 Π ⁡ ( a , E ) \Pi(a,E) 授权执行当且仅当 G a G_{a} 中的每个谓词都与证书匹配;自由格式的 MLLM 文本在结构上不可接受作为证据 ( × )。