论文

PrivUn:揭示隐私遗忘中的潜在涟漪效应和浅层遗忘

PrivUn: Unveiling Latent Ripple Effects and Shallow Forgetting in Privacy Unlearning

模型评测安全与风险评测

摘要

大语言模型(LLM)在训练过程中经常记住私人信息,引发严重的隐私问题。虽然机器学习已成为一种有前途的解决方案,但其针对隐私攻击的真正有效性仍不清楚。为了解决这个问题,我们提出了 PrivUn,一个新的评估框架,通过三层攻击场景系统地评估遗忘的鲁棒性:直接检索、上下文学习恢复和 微调 恢复;结合使用遗忘分数、关联指标和遗忘深度评估的定量分析。我们的研究暴露了当前遗忘方法的显着弱点,揭示了两个关键发现:1)遗忘表现出梯度驱动的连锁反应:与遵循语义关系(例如知识图)的传统遗忘不同,隐私遗忘在基于潜在梯度的关联中传播; 2)大多数方法都存在浅层遗忘,无法删除分布在多个深层模型层的私人信息。为了验证这些见解,我们探索了两种策略:利用梯度相似性的关联感知核心集选择,以及通过表征约束进行多层深度干预。这些策略代表了从浅层遗忘到深度遗忘的范式转变。