论文
通过注意力集中进行偏好重定向:对计算机使用代理的攻击
Preference Redirection via Attention Concentration: An Attack on Computer Use Agents
摘要
多模式基础模型的进步使得能够与 GUI 环境自主交互的计算机使用代理 (CUA) 的开发成为可能。由于 CUA 不限于某些工具,它们允许自动执行更复杂的代理任务,但同时也会带来新的安全漏洞。虽然之前的工作集中在语言模态上,但视觉模态的脆弱性受到的关注较少。在本文中,我们介绍了 PRAC,这是一种新颖的攻击,与直接针对 VLM 输出的先前工作不同,它通过将注意力转向隐秘的对抗性补丁来操纵模型的内部偏好。我们证明 PRAC 能够操纵在线购物平台上 CUA 的选择过程来选择目标产品。虽然我们需要对模型进行白盒访问来创建攻击,但我们表明,我们的攻击泛化到同一模型的微调版本,这在多家公司基于开放权重模型构建特定 CUA 时构成了严重威胁。