论文

SCOUT:协同推理和工具使用以确保计算机使用安全

SCOUT: Synergizing Reasoning and Tool-Use for Computer-Use Safety

AI 基础设施AI安全与内容治理基础设施

摘要

计算机使用Agent (CUA) 虽然能够在日常和专业工作流程中完成计算机任务,但即使在良性指令和环境下也可能造成意外伤害。然而,检测这种危害仍然具有挑战性。首先,它需要仔细的、针对具体任务的推理:仅受一般安全标准指导的验证者往往会忽视许多重要但微妙的有害行为。其次,它需要积极的调查:过去的轨迹屏幕截图显示了智能体做了什么,但并不总是环境中实际发生的变化,因此仅依靠屏幕截图的 LLM 作为评审的验证者可能无法确定操作的实际后果。为了应对这些挑战,我们推出了 SCOUT,这是一种两阶段的 Agentic 安全验证器,可将推理密集型标题生成与工具密集型证据收集相结合。首先,我们的 SCOUT 规则生成器对任务和Agent的轨迹进行广泛推理,以确定成功和安全的执行需要什么,从而生成特定于任务的完成和安全规则。然后,我们的 SCOUT 探测Agent遵循这些规则与执行后环境进行交互,并收集有根据的证据以进行最终的安全性和完成判断。我们根据两个计算机使用安全基准评估我们的框架。在 AutoElicit-Bench 上,SCOUT 达到 75.4 不安全 F1 和 74.5 完成 F1,优于 LLM 作为评审验证者和朴素工具使用验证者。 SCOUT 以 76.4% 的不安全检测准确率领先于 OS-Blind。测试时反射将 AutoElicit-Bench 上的最终不安全执行率从 30.2% 降低到 17.2%。消融和分析表明,SCOUT 中的免工具生成规则可以引发更多推理,对于跨验证者主干(尤其是非前沿主干)的安全检测至关重要。对编码任务的初步扩展表明 SCOUT 可以支持计算机使用之外的安全验证。