论文
AgentLeak:多代理 LLM 系统中隐私泄露的全栈基准
AgentLeak: A Full-Stack Benchmark for Privacy Leakage in Multi-Agent LLM Systems
摘要
多代理大语言模型 (LLM) 系统会产生当前基准无法衡量的隐私风险。当代理协调任务时,敏感数据会通过代理间消息、共享内存和工具参数传递;仅输出审计从不检查的路径。我们推出 AgentLeak,据我们所知,这是第一个涵盖内部渠道的隐私泄露全栈基准,涵盖医疗保健、金融、法律和企业领域的 1,000 个场景,并配有 32 类攻击分类法和三层检测管道。在 4,979 个跟踪中测试 GPT-4o、GPT-4o-mini、Claude 3.5 Sonnet、Mistral Large 和 Llama 3.3 70B 表明,多代理配置减少了每通道输出泄漏(C1:27.2% 对比单代理中的 43.2%),但引入了不受监控的内部通道,将总系统暴露率提高到 68.9%(跨 C1、OR 聚合) C2、C5)。内部渠道占了这一差距的大部分:代理间消息 (C2) 泄漏率为 68.8%,而 C1(输出通道)泄漏率为 27.2%。这意味着仅输出审计会漏掉 41.7% 的违规行为。 Claude 3.5 Sonnet在设计中强调安全一致性,在外部(3.3%)和内部(28.1%)通道上实现了最低泄漏率,这表明模型级安全训练可能会转移到内部通道保护。在所有五个模型和四个域中,模式 C2 > C1 一致,证实代理间通信是主要漏洞。这些发现强调了协调框架的必要性,该框架纳入内部渠道隐私保护并对代理间通信实施隐私控制。
