论文

OSGuard:面向计算机使用智能体安全的基准

OSGuard: A Benchmark for Safety in Computer-Use Agents

智能体系统Agent任务评测长程任务评测

摘要

人们越来越多地根据计算机使用代理是否完成现实的桌面和网络任务来对其进行评估。然而,仅任务成功可能会错过代理通过不安全的捷径达到名义目标的失败。我们推出了 OSGuard,这是一个双粒度基准套件,用于在良性、未更改的用户指令下评估计算机使用代理的安全性。 OSGuard 包含用于本地护栏决策的行动级基准和用于端到端评估的风险增强执行套件。操作级基准由标记为允许、不相关或不安全的上下文建议操作组成,每个操作都相对于原始指令和当前接口状态进行判断。执行套件包含手动构建的 OSWorld 派生任务变体,其中原始任务仍然可以实现,但环境被修改以引入潜在危险,例如破坏性覆盖等。每个变体都与增强评估器配对,这些评估器保留原始任务成功标准,同时添加显式基于状态的安全不变量,使我们能够区分满足标称任务目标的安全完成和不安全完成。我们在 OSGuard 上的实验结果表明,当前的多模态护栏可以在孤立的行动判断上表现良好,而风险增强执行则暴露了本地监督和可靠的端到端安全之间仍然存在的差距。这种双粒度设计可以更精确地诊断模型在部署为护栏时是否既可以识别不安全的建议操作,又可以提高全任务安全性。

OSGuard:面向计算机使用智能体安全的基准:论文配图
图 1:OSGuard 基准测试概述。 (a) 动作级基准的构建源:标准 OSWorld 执行、具有状态兼容提议者动作的中断前缀、具有不安全提议者动作的中断前缀以及风险增强的变体执行。 (b) 动作级护栏任务:给定原始指令、动作前状态和候选动作,护栏预测允许、不相关或不安全。 (c) 风险增强执行套件:原始指令保持固定,同时修改环境以引入潜在危险;增强评估器保留原始的成功检查并添加基于状态的安全不变量。