论文

LLM 内部知道什么是私有的吗?探测和引导 大语言模型 表示中的上下文隐私规范

Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地部署在高风险环境中,但它们经常在人类可以行使自由裁量权的情况下披露私人信息,从而侵犯上下文隐私。这就提出了一个基本问题:LLM 是否在内部编码上下文隐私规范?如果是,为什么违规行为仍然存在?我们在 LLM 中提出了第一个将上下文隐私作为结构化潜在表示的系统研究,该研究基于上下文完整性(CI)理论。通过探索多个模型,我们发现三个决定范数的 CI 参数(信息类型、接收者和传输原理)被编码为激活空间中线性可分离且功能独立的方向。尽管有这种内部结构,模型在实践中仍然会泄露私人信息,揭示了概念表示和模型行为之间的明显差距。为了弥补这一差距,我们引入了 CI 参数控制,它沿着每个 CI 维度独立干预。这种结构化控制比整体控制更有效、更可预测地减少了隐私侵犯。我们的结果表明,上下文隐私失败是由于表示和行为之间的不一致而不是意识缺失引起的,并且利用 CI 的组成结构可以实现更可靠的上下文隐私控制,这揭示了 LLM 中上下文隐私理解的潜在改进。