论文

改变梯度:了解防御性训练方法如何保护语言模型的完整性

Shifting the Gradient: Understanding How Defensive Training Methods Protect Language Model Integrity

模型评测模型行为与机制分析

摘要

积极预防性引导(PPS)和接种提示(IP)等防御性训练方法通过看似相似的过程提供了令人惊讶的结果:两者都在训练期间向 大语言模型(LLM)添加特质诱导对象,并且都保护 LLM 不获得该特质。这些方法取得了惊人的成功,但随之而来的问题是:它们是如何发挥作用的? PPS 和 IP 做的是同一件事吗?我们使用“邪恶”作为案例研究特征,对这两种方法进行了行为和机制比较。我们的主要发现是 PPS 和 IP 通过不同的机制实现其防御优势。在行为上,我们表明 PPS 和 IP 都不是通过纯粹的关联机制运行的; PPS 既可以防御性状获得,又可以主动减少预先存在的表达,而 IP 在之前经过微调以表达性状的模型中无效。这种行为差异在机制上得到了体现:PPS 将激活梯度沿 PPS 向量轴向衰减方向移动。当 PPS 向量与特征表达轴对齐时,它可以反转梯度压力,减少而不是增加沿该轴的激活。相比之下,知识产权继续抵制精确的机械解释。直接余弦相似性分析表明,IP 具有与 PPS 不同的梯度特征,定性分析表明 IP 的梯度更加分散。此外,IP 减少了 PPS 不需要的特征表达数据上的下一个标记预测损失,这与 IP“解释”训练数据中的特征表达的概念一致。总而言之,我们的分析揭示了每种方法运作的不同机制,并强调了有关知识产权机制图景的悬而未决的问题。