论文
有秘密吗?LLM代理守不住它:评估多代理系统中的隐私
Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems
摘要
LLM 安全评估主要在隔离环境中测试模型,但已部署的 AI 代理越来越多地与其他代理一起运行在持久的社会环境中。我们引入一个 Moltbook 风格的模拟平台,数千个 LLM 代理在模拟的一个月里跨社区互动,并用它在不同程度的社会压力下评估作为下游安全问题的隐私。我们发现,从单轮转向多轮社会评估会放大隐私违规(在 OpenAI 模型上从 CIMemories 的 19.95% 升至本工作的 45.30%);泄露具有社会传染性:在观察到同伴泄露之后,代理泄露敏感信息的可能性高 8 倍;明确的隐私指令能减少但不能消除这一效应,即便有防护措施,泄露率仍高于 37.8%。我们的发现表明,基于静态聊天的安全基准会系统性低估代理式部署的风险,而仅凭社会情境就足以引发单轮评估永远不会暴露的敏感披露。
