论文

一致性训练,同时通过速率匹配减轻混淆

Consistency Training while Mitigating Obfuscation via Rate Matching

模型训练监督微调与指令调优

摘要

大语言模型 通常会受到无关输入特征的影响,例如揭示用户首选答案的提示。一致性训练通过训练模型在有或没有无关特征的输入之间表现相似来减少这种影响。然而,现有的方法训练整个响应或内部激活的一致性,这也限制了模型是否用语言表达所述无关特征。我们证明这会导致混淆,模型学会不提及提示,同时仍受其影响,这可能会破坏可监控性。为了解决这个问题,我们引入了速率匹配一致性训练(RMCT),它训练所选行为属性的一致性,而不限制这种行为的表达方式。 RMCT 匹配模型在输入扰动中表现出目标行为(例如,遵循偏差提示)的速率,而不是要求具有或不具有无关特征的配对输入,将一致性训练扩展到无法删除无关特征的设置。我们在两个开放权重语言模型中评估了 RMCT 在减少阿谀奉承方面的效果,与针对保留偏差类型的标准一致性训练基线相比,实现了偏差跟踪的减少,同时在很大程度上保留了模型用语言表达偏差线索的倾向。此外,我们发现 RMCT 的数据效率更高,但在实验中计算效率较低。总体而言,RMCT 表明一致性训练可以提高行为稳健性,而无需直接权衡可监控性。