论文
不要接种一切:分层接种提示缩小后门触发并保留所需的特征
Don't Inoculate Everything: Stratified Inoculation Prompting Narrows Backdoor Triggers and Preserves Desired Traits
摘要
有监督的微调可以教会语言模型不期望的行为以及期望的行为。接种提示(IP)旨在通过在训练期间请求不良行为并在推理时删除请求来限制不需要的泛化。但是,在不相关的提示下仍然可能出现不良行为。知识产权还会阻碍对所需行为的学习。我们在大多数训练示例中同时出现两种行为的设置中解决了这些限制,因此过滤掉具有不良行为的示例只留下一小部分干净的子集。我们引入分层接种提示(SIP)。 SIP 利用一个干净的小子集来证明所需的行为应该在不同的上下文中持续存在,而不会出现不需要的行为。 SIP 在不同的非诱导提示下对这些干净的示例进行过采样,同时接种其余的示例。 SIP 大大减少了不良行为的表达,同时比 IP 保留了更多的所需行为。即使我们扩展 IP 以与 SIP 相同的速率对相同的干净子集进行过采样,这些收益仍然存在。此外,在我们测试的所有有害建议设置中,SIP 产生的紧急错位率较低。即使在明确请求的提示下,SIP 也可以进一步扩展以限制不良行为。我们引入了后门稀释(在接种提示下削弱表达)和密码锁定接种(将诱导集中在指定密码上)。综上所述,我们的研究结果表明,改变一小部分干净子集的训练环境可以显着提高选择性泛化。