论文

通过对比遗忘集忘却大语言模型中的欺骗行为

Unlearning Deceptive Behaviors in LLMs with Contrastive Forget Sets

模型训练模型编辑与遗忘

摘要

大语言模型通常知道真相,但又说相反的话:一旦上下文奖励它,一个在中立询问时正确回答的模型将肯定用户的错误信念,或者错误地陈述其系统提示想要隐藏的事实。这种欺骗是一种以上下文而不是知识为条件的行为,但机器遗忘是从权重中删除行为的自然工具,旨在忘记欺骗模型仍然需要的事实。我们建议在模型欺骗时而不是它所知道的情况下忘记学习,通过根据模型自己实现的欺骗构建的对比遗忘单元:在欺骗触发和中立背景下的相同问题,仅在信念成立和行为翻转时才被承认。该单元的标准目标面临着两难境地。非营利组织等镇压目标使大部分欺骗行为得以继续。基于目标的目标将模型的中性行为提炼到压力环境中,将其消除,但会导致环境失明:在没有环境的情况下生成的目标会教导模型停止读取它,从而侵蚀良性的系统提示指令、保密性和监视器检查的推理,这是欺骗率和能力基准看不见的失败。我们引入了 PACT,它针对压力感知的反事实目标进行训练(模型自己的诚实响应,带有记录压力并抵抗压力的痕迹),同时保留触发上下文的良性使用。在两个 32B 推理模型上,PACT 将保留欺骗从 50% 以上减少到 3% 以下,同时系统提示遵守、保密和推理跟踪保持在基本模型的水平。在移除与留出集的拉锯战得分中,PACT 达到 0.94 和 0.86,而任何基线最多为 0.77 和 0.60。与删除的知识一样,删除的欺骗在重新学习下是浅薄的,而模拟攻击者的术语仅在上下文使用中付出代价才能保留它。