论文
通过统一域表示和双向协调多目标 LLM 遗忘 logits 蒸馏
Harmonizing Multi-Objective LLM Unlearning via Unified Domain Representation and Bidirectional Logit Distillation
摘要
大语言模型 (LLM) 遗忘对于从模型中删除危险或泄露隐私的信息至关重要。实用的 LLM 忘却需要同时满足多个具有挑战性的目标:删除不需要的知识,保留通用实用性,避免过度拒绝相邻概念,最重要的是,确保对抗性探测攻击的鲁棒性。然而,现有的忘却方法主要关注这些目标的有限子集,通常忘却功效和效用保留,同时忽视鲁棒性和边界行为。天真地将这些方法扩展到多目标设置可能会导致忘记学习任务干扰。我们提出了一种新颖的多目标忘却框架,通过数据和优化协同设计来协调多个忘却目标:我们将训练语料库标准化为统一的数据表示,以减少域差距,然后引入双向 蒸馏 方法,该方法同时从上下文指导的教师中引出所需的行为,同时抑制学生模型中的不良行为。理论和实证分析表明,我们的方法对齐了域分布,并将看似不相关的不学习任务转化为合作优化。评估展示了最先进的性能,可以在不同的、具有挑战性的要求中实现平衡和可靠的忘却。