论文

沿 Transformer 堆栈的一致性训练

Consistency Training Along the Transformer Stack

模型训练监督微调与指令调优

摘要

一致性训练鼓励模型在不同环境下表现相似,并显示出减少偏差的希望。我们通过两种方式扩大一致性训练的范围。首先,我们引入两个新的内部一致性目标:MLP 一致性训练(MLPCT),它匹配激活后的 MLP 状态;以及注意力一致性训练(AttCT),它匹配每个头的注意力分布。其次,我们将一致性训练应用于四种额外的安全威胁:角色上下文学习攻击、对抗性挫败、预填充攻击和条件错位。在多个模型和威胁设置中,我们发现一致性训练减少的偏差远远超出了先前工作中研究的阿谀奉承和越狱设置。我们还发现了跨威胁泛化的案例,其中针对一种故障模式的训练提高了另一种故障模式的鲁棒性,并确定了 ACT、MLPCT 和 AttCT 背后的共享残余流机制,同时将 BCT 区分为机械上不同的。我们的结果表明,一致性训练是一种灵活且可扩展的对齐框架,能够统一防御更广泛的模型病理类别。