论文

ClawSafety:“安全”的LLM,不安全的智能体

ClawSafety: "Safe" LLMs, Unsafe Agents

智能体系统Agent HarnessAgent任务评测Agent Skills

摘要

像 OpenClaw 这样的个人 AI 代理在用户的本地计算机上以更高的权限运行,其中一次成功的提示注入可能会泄露凭据、重定向金融交易或破坏文件。这种威胁远远超出了传统的文本级越狱,但现有的安全评估存在缺陷:大多数测试模型在孤立的聊天设置中依赖于合成环境,并且没有考虑代理框架本身如何塑造安全结果。我们推出了 CLAWSAFETY,这是一个由 120 个对抗性测试场景组成的基准,按照三个维度(危害领域、攻击向量和有害行为类型)进行组织,并基于跨越软件工程、金融、医疗保健、法律和 DevOps 的现实、高权限专业工作空间。每个测试用例都将对抗性内容嵌入代理在正常工作期间遇到的三个渠道之一:工作区技能文件、来自受信任发件人的电子邮件和网页。我们评估了五个前沿 LLM 作为代理骨干,在所有配置中运行 2,520 次沙盒试验。不同模型的攻击成功率 (ASR) 范围从 40% 到 75% 不等,并且因注入向量的不同而差异很大,其中技能指令(最高信任)始终比电子邮件或网页内容更危险。操作跟踪分析表明,最强的模型针对凭证转发和破坏性操作保持硬边界,而较弱的模型则允许这两种行为。三个代理框架的跨支架实验进一步证明,安全性不仅仅由骨干模型决定,而是取决于完整的部署堆栈,需要将模型和框架视为联合变量的安全评估。

ClawSafety:“安全”的LLM,不安全的智能体
图 1:S1-S5 的 ASR 平均值。