论文
衡量而非优化:预测 LLM 中的恢复
Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning
摘要
先前的白盒研究表明,大语言模型 在取消学习后可以保留目标知识的潜在痕迹,即使这些知识不再在其输出中表达。然而,现有的审计仍然仅限于一次性诊断:尚不清楚这些残留信号是否可以预测持续训练下的未来恢复或作为可靠的优化目标。解决这一差距对于确定内部审计是否可以超越事后评估转向主动风险监控和更安全的忘却至关重要。我们提出了 J-Access,这是一种推理时间审计,它使用雅可比透镜将中间表示映射到词汇空间,并测量目标概念沿着模型的输出路径保持可访问的频率。我们假设残余可访问性反映了恢复敏感性:更接近输出路径的知识需要更少的 微调 来恢复,从而导致更快的恢复。我们审核了 398 个公共未学习模型,涵盖八种遗忘方法。我们发现:(1)大多数未学习模型保留的访问权限高于仅保留参考水平; (2)攻击前可访问性在模型级别预测恢复速度和程度,但无法确定将恢复哪些具体事实; (3)直接最小化J-Access并不能促进真正的删除。相反,该模型会学习隐藏审计知识,从而产生较低的审计分数,但攻击后的恢复能力更强。这些发现将 J-Access 定位为模型级诊断,用于评估未学习模型中的残留敏感性。我们认为内部审计应该作为忘却评估的独立诊断维度,并且不应在未经验证的情况下转化为优化目标。