论文
WeClawArena:以人为中心的Agent网络跨用户协作与安全审计沙箱
WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks
摘要
近年来,持续性个人代理框架的进步使人类中心的代理网络成为现实部署的目标:每个用户都可以由AI代理服务,这些代理在用户的名义下行动、维护状态并通过社会和任务关系与其他代理通信。在这些网络中,日常工具使用转变为多用户拥有代理的协作,其中文件、记录、工具和政策不直接可见于所有者之间。现有的代理基准研究工具使用和协作,但它们没有提供一个端到端的沙箱来验证与现实用户数字工作空间相关的可验证跨用户代理协作或测试有害行为如何在人类中心的代理网络中传播。我们引入WeClawArena,这是一个可审计的基准和运行时沙箱,用于多用户拥有代理在个人工作空间上的协作。WeClawArena的目标是在个人工作空间上作为操作工具和个人约束的任务上进行协作。基准包含六种跨用户任务域中的124个基础任务,并扩展为620个变体,每个基础任务有一个良性控制和四个攻击向量变体。沙箱记录同伴消息、工具调用、资源操作、受控决策和最终工作空间状态。WeClawArena报告实用性和攻击成功率,并审计从受限运行证据中成功的攻击,支持诊断任务失败、隐私泄露、有毒证据以及无效权限路径。
