论文
基于注意力头干预的LLM个性化隐私控制
Personalized Privacy Control in LLMs via Attention Head Intervention
摘要
智能体AI的兴起使LLM能够访问多样的用户数据,引发关键的隐私担忧。此前关于情境隐私的工作研究LLM是否依据依赖情境的规范调节信息披露。然而,即使在相同情境下,可接受的信息披露边界也可能因用户而异。为解决这一局限,我们提出个性化隐私,把用户特定的披露偏好纳入隐私控制。我们进一步提出P3Bench(个性化隐私保护基准),一个以个性化披露政策扩展情境隐私政策的新基准。实验表明,基于提示词的政策无法可靠地执行个性化隐私政策,Qwen2.5-7B和Gemma3-4B的平均政策忽视率分别为51.25%和74.28%。最后,为解决这一问题,我们提出Repair,一种稳健的推理时注意力头干预方法,把披露行为调整到符合政策的回应上。我们的方法显著提高了对用户特定隐私偏好的遵从,减少了模型未能遵循给定政策的案例。
