论文

MPSelectTune:微调 的提示类型选择改进了 LLM 中的概念遗忘

MPSelectTune: Prompt-type Selection for Fine-tuning improves Concept Unlearning in LLMs

模型训练模型编辑与遗忘

摘要

LLM 可以使用适当的提示和少量示例,方便地适应各种任务,例如预测、问答任务等。有偏见或有害的概念,例如预训练的 LLM 中存在的性别或生物武器可能会导致对许多此类提示做出不安全或不道德的反应。在不同的提示类型中稳健地删除这些不需要的概念仍然是一个具有挑战性的问题,因为现有的遗忘方法通常忽略提示变化的影响。在本文中,我们探索了一种新颖的对抗性方法,使用联合提示来进行主要任务和概念任务预测。我们表明,与使用所有提示类型组合的 微调 方法相比,使用“最差提示类型”进行概念预测(具有最高概念准确性)的 微调 提高了平均遗忘性能。我们提出的方法 MPSelectTune 是一种两阶段方法,在 微调 使用使用多种提示类型的新型多任务损失之后,可最小化最高准确度提示类型的概念准确度。四个基准测试的实验结果显示,与最近的基线相比,主要任务准确性提高了 2 - 15\%$,同时与最近的基线相比,最坏情况的概念准确性降低了高达 $17\%$。