论文

从助手到双重Agent:针对个性化本地AI Agent OpenClaw的攻击形式化与基准测试

From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

尽管以OpenClaw为代表的大语言模型(LLM)智能体正日益从面向任务的系统演化为解决复杂现实任务的个性化AI助手,但其实际部署也引入了严重的安全风险。然而,现有智能体安全研究与评估框架主要关注合成或以任务为中心的设定,因而无法准确刻画个性化智能体在真实部署中的攻击面与风险传播机制。为填补这一空白,我们提出个性化智能体安全基准(Personalized Agent Security Bench,PASB),一个为真实世界个性化智能体量身打造的端到端安全评估框架。PASB在现有智能体攻击范式的基础上,纳入个性化使用场景、真实工具链与长程交互,支持对真实系统开展黑盒端到端安全评估。我们以OpenClaw为代表性案例,在多种个性化场景、工具能力与攻击类型上系统评估其安全性。结果表明,OpenClaw在不同执行阶段(包括用户提示处理、工具使用与记忆检索)均存在关键漏洞,凸显了个性化智能体部署中的重大安全风险。所提出PASB框架的代码发布于 https://github.com/AstorYH/PASB。

从助手到双重Agent:针对个性化本地AI Agent OpenClaw的攻击形式化与基准测试
图1:个性化LLM Agent的威胁图景。该agent与外部环境(内容枢纽与工具)交互,并维护一个私有记忆。