论文
MIRAGE:用于 Web 代理中漏洞检测的隐形视觉提示注入
MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents
摘要
基于多模态 大语言模型 (MLLM) 的网络代理为视觉浏览器自动化提供实用、高精度的解决方案;然而,它们本质上扩大了攻击面,引入了新的基于视觉的漏洞。针对这些代理的现有对抗性评估经常依赖于宽松的威胁模型和视觉上显眼的工件。在本文中,我们研究了受约束的漏洞检测设置:一个受信任的网络平台,其中评估者仅充当无特权的第三方(例如商家或广告商),仅控制语义上合法的、空间受限的区域,例如广告位、赞助卡或本地化小部件。在这些现实限制下,我们提出了 MIRAGE,一种新颖的视觉间接提示注入框架,用于有针对性的下一步行动劫持。我们的方法利用扩散模型来生成感知良性的对抗性图像,这些图像严格限制在可信服务提供商允许的攻击者控制的边界内。为了在这种限制性设置下最大限度地提高攻击效率,我们引入了一种鲁棒的优化技术,将曲率感知的对抗扩散引导与稀疏的暗像素残余扰动相结合。针对著名的 MLLM Web 代理框架(特别是 SeeAct 和 OpenClaw)的综合评估,凭经验证明了我们提出的 MIRAGE 的效力、现实性和隐蔽性。