论文
MirrorGuard:经仿真到真实的推理纠错迈向安全的计算机使用智能体
MirrorGuard: Toward Secure Computer-Use Agents via Simulation-to-Real Reasoning Correction
摘要
大型基础模型被集成到计算机使用智能体(CUA)中,使其能够通过图形用户界面(GUI)与操作系统自主交互以完成复杂任务。这种自主性带来严重安全风险:恶意指令或视觉提示注入可能触发不安全推理并造成有害的系统级操作。现有防御(如基于检测的阻断)能防止损害,但常常过早中止任务,降低智能体效用。本文提出 MirrorGuard,一个即插即用的防御框架,利用基于仿真的训练提升 CUA 在真实世界中的安全性。为降低在操作系统中大规模训练的成本,我们提出一种新颖的神经符号仿真管线,完全在基于文本的仿真环境中生成真实、高风险的 GUI 交互轨迹,在不执行真实操作的情况下捕捉不安全推理模式和潜在系统危害。在仿真环境中,MirrorGuard 学会在 CUA 产生并执行不安全动作之前拦截并纠正其不安全推理链。在真实世界测试中,跨多样基准与 CUA 架构的广泛评估表明 MirrorGuard 显著降低安全风险。例如,在字节跳动 UI-TARS 系统上,它把不安全率从 66.5% 降至 13.0%,同时保持边际的误拒率(FRR)。相比之下,最先进的 GuardAgent 只能降至 53.9%,且 FRR 高出 15.4%。我们的工作证明源自仿真的防御可以在保持智能体基本效用的同时提供鲁棒的真实世界保护。代码与模型公开于 https://bmz-q-q.github.io/MirrorGuard/。
