论文
CAP:LLM 中遗忘的可控对齐提示
CAP: Controllable Alignment Prompting for Unlearning in LLMs
摘要
在未经过滤的语料库上进行训练的 大语言模型 (LLM) 固有地存在保留敏感信息的风险,需要选择性地忘记知识以实现监管合规性和道德安全。然而,现有的参数修改方法面临着根本的局限性:高计算成本、不可控的遗忘边界以及对模型权重访问的严格依赖。这些限制使得它们对于闭源模型来说不切实际,但当前的非侵入性替代方案仍然不系统且依赖于经验经验。为了应对这些挑战,我们提出了可控对齐提示遗忘(CAP)框架,这是一种端到端提示驱动的遗忘范式。 CAP 通过强化学习将学习解耦为可学习的提示优化过程,其中提示生成器与 LLM 协作抑制目标知识,同时有选择地保留一般功能。这种方法可以通过及时撤销来实现可逆的知识恢复。大量实验表明,CAP在不更新模型参数的情况下实现了精确、可控的失学习,建立了动态对齐机制,克服了现有方法的可迁移性限制。