论文
CBD:仅 API LLM 通过受控行为分歧实现黑盒遗忘
CBD: API-Only LLM Black-Box Unlearning through Controlled Behavioral Divergence
摘要
边缘设备越来越多地通过 API 服务调用 大语言模型 (LLM),以实现上下文感知边缘智能,同时可以收集边缘生成的数据以改进 LLM,并可能将敏感、受版权保护、有害或过时的信息引入模型行为。机器取消学习提供了一种实用的方法来消除不需要的数据的影响,而无需重新训练 LLM。然而,现有方法仍然面临两个差距。第一个是仅 API 黑盒访问,其中目标模型参数和内部 logits 不可用。第二个是当忘记目标数据和保留数据共享高度相似的提示结构或语义模式时如何保留保留效用。为了应对这些挑战,我们提出了受控行为分歧(CBD),这是一种仅 API 的黑盒反学习框架。 CBD 使用两个辅助模型在保留输入和遗忘目标输入之间创建受控行为差异,将这种差异转换为遗忘相关性分数,并将遗忘相关提示路由到远离目标 LLM 的位置。为了提高目标数据和保留数据高度相似性下的判别准确度,CBD通过估计经验Fisher矩阵并解决正则化广义特征值问题,构建基于梯度统计的判别基础,引导未学习信号朝向目标特定信息而不是共享提示结构。与 11 个白盒和灰盒遗忘基线相比,CBD 实现了更好的遗忘效用权衡,并且其性能在不同设置下变化很小。在 ToFUforget10 上,CBD 接近遗忘集上的重新训练参考,同时将模型效用提高到 74.90,比第二最佳基线高出约 15%。在 WMDP 上,它将危险知识准确度降低至 25.68,接近随机猜测,同时保留 MMLU 准确度 52.67。代码位于 https://github.com/DGL-codes/CBD。