论文
MuPPET:多方对话中 LLM 助手的上下文隐私基准
MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations
摘要
LLM 代理越来越多地部署在多方环境中,代表个人用户处理敏感的个人数据,例如在群聊中。当这样的代理泄露私人信息时,它会立即到达每个组成员。这种风险在结构上比一对一设置更难控制,因为每条私人信息都必须适合组中的每个接收者。然而,所有现有的上下文隐私基准仅考虑单一对话者设置,而无法衡量多方隐私风险。我们引入 MuPPET(多方隐私暴露测试),这是多方对话中上下文隐私的基准。我们的实验表明,模型在多方环境中的泄漏比一对一评估显示的要多得多。前沿模型很容易受到攻击,而较小的开放权重模型通常更适合用于敏感数据的本地部署,甚至更是如此。现有的上下文隐私防御仅提供部分保护,降低了实用性,并且不能解决潜在的各方跟踪问题。