论文
LLM角色忘却
LLM Persona Unlearning
摘要
预训练为大语言模型 (LLM) 配备了与角色、风格、价值观和目标相关的广泛行为模式。训练后会教授条件制定,并将有用的助手设置为默认值,但它不会从权重中删除替代模式;因此,明确的提示可以引发反复塑造判断、语言和行动的角色。在开放权重设置中,可以删除运行时控制,从而激发角色遗忘:权重级别的编辑使指定的角色难以在未见过的上下文中引出和执行。我们引入了 PersonaUnlearnBench,这是一个特定于模型的配对基准,涵盖来自三个家庭和五个角色的六名大语言模型,具有对齐的遗忘/保留集、保留指令释义和四轴评估。该基准表明,标准的遗忘方法无法在不牺牲有意义的生成或一般效用的情况下可靠地消除目标角色。因此,我们提出 PaCE,它将对相同问题的目标响应和期望响应进行比较,以定位内部行为方向,然后训练目标提示状态远离目标模式并朝向匹配的期望响应。实验表明,PaCE 始终以适度的效用成本抑制具有高响应质量和有用的对应行为的目标角色。这些结果将角色遗忘确立为一个独特的行为级别编辑问题,以及持久控制潜在大语言模型响应策略的实用途径。