论文

AgentPrivArena:评估和审核现实世界的人工智能智能体隐私

AgentPrivArena: Evaluating and Auditing Real-world AI Agent Privacy

模型评测安全与风险评测

摘要

LLM智能体的快速发展使系统能够通过外部工具自主执行复杂的任务,但它们对个人数据的不断增长的访问带来了重大的隐私风险。现有基准主要通过模拟轨迹和基于结果的指标来评估LLM智能体隐私,限制了它们捕获多步骤智能体执行过程中出现的隐私风险的能力。在这项工作中,我们引入了 AgentPrivArena,这是一个用于评估现实LLM智能体工作流程中隐私风险的框架。 AgentPrivArena 在可重现的执行环境中集成了真实的 MCP 工具和自托管服务。我们进一步提出轨迹级隐私指标,量化最终响应泄漏之外的不必要的信息访问。在此框架的基础上,我们引入了 AgentPrivAudit,这是一种运行时审计方法,用于监控智能体执行期间的隐私侵犯行为。对最先进的LLM智能体进行的广泛实验揭示了现有评估范式忽视的重大隐私风险,凸显了轨迹级审计对于值得信赖的智能体部署的重要性。

AgentPrivArena:评估和审核现实世界的人工智能智能体隐私的原论文方法或结果图
图 1:AgentPrivArena。左:每个源场景都转换为任务规范以及每个服务种子文件,因此它描述的记录作为服务状态而不是提示中的文本存在。中心:种子服务通过 MCP 服务器公开其本机 API,敏感记录位于其中,只能通过智能体自己的读取来访问。右图:智能体计划、调用工具并积累观察结果,直到采取最终行动。突出显示的观察结果是单步评估不够的原因:任务相关内容(绿色)和受保护内容(红色)在一次读取中一起到达,并从那时起保留在上下文中。