论文

有秘密吗?LLM代理守不住它:评估多代理系统中的隐私

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

模型评测安全与风险评测

摘要

LLM 安全评估主要在隔离环境中测试模型,但已部署的 AI 代理越来越多地与其他代理一起运行在持久的社会环境中。我们引入一个 Moltbook 风格的模拟平台,数千个 LLM 代理在模拟的一个月里跨社区互动,并用它在不同程度的社会压力下评估作为下游安全问题的隐私。我们发现,从单轮转向多轮社会评估会放大隐私违规(在 OpenAI 模型上从 CIMemories 的 19.95% 升至本工作的 45.30%);泄露具有社会传染性:在观察到同伴泄露之后,代理泄露敏感信息的可能性高 8 倍;明确的隐私指令能减少但不能消除这一效应,即便有防护措施,泄露率仍高于 37.8%。我们的发现表明,基于静态聊天的安全基准会系统性低估代理式部署的风险,而仅凭社会情境就足以引发单轮评估永远不会暴露的敏感披露。

有秘密吗?LLM代理守不住它:评估多代理系统中的隐私:论文配图
图 1.来自我们的多主体模拟的定性示例,展示了社会环境如何推动信息披露。 (a) 在有机线索中,中性提示不会引出敏感内容,但早期回复会引入姓名、年龄、雇主和健康信息等识别详细信息。随后的特工升级了,添加了从未征求过的家庭和个人历史详细信息。 (b) 在对抗性的社会压力下,明确的修订指示仍然无法防止泄密。在极端情况下,代理在暴露披露标准化内容后,在 29 次写入中的 27 次中披露了敏感属性。突出显示的范围表示 PII 类别。所有角色都是合成的。