论文

隐形墨水威胁:计算机使用代理中合法任务背后的敌对目标

Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents

智能体系统Agent任务评测

摘要

计算机使用代理 (CUA) 使 大语言模型 能够自主操作系统和网络,但越来越容易受到间接提示注入攻击。一种广泛采用的防御方法是人机循环范例,其中代理在执行敏感操作之前暂停以进行明确的用户确认。虽然可以有效抵御明显的高危害攻击,但这种防御对于我们所说的“隐形墨水威胁”几乎没有提供任何保护:低危害注入目标,例如为存储库添加星标或安装软件包,这些目标在行为上与合法任务执行没有区别,因此可以逃避模型安全机制和人类监督。为了系统地研究这个盲点,我们提出了 II-Bench,这是一系列看似无害的对抗性任务。 II-Bench 包含 444 个针对三个平台的机密性和完整性攻击的示例,涵盖三个攻击类别:页面导航和交互、敏感信息泄露以及代码下载和执行。每个类别都在两个指令特异性级别下以自然语言和代码形式实例化。此外,我们构建了 HITLCUA,一个全面的对抗性测试框架,它将真实的虚拟机操作系统环境与基于 Docker 的隔离 Web 平台集成在一起,并通过允许 CUA 在进行可疑操作之前咨询 API 模拟用户来模拟人类参与。对领先 CUA 的广泛评估表明,低危害注入经常绕过代理防御和模拟用户审查,暴露了当前 CUA 中严重且先前未充分研究的安全风险。