论文
一致性训练会加剧偏差
Consistency Training Can Entrench Misalignment
摘要
一致性训练鼓励模型在相关输入或采样过程中产生相似的输出。此类方法简单、可扩展且基本上无需标签,但它们对模型对齐的影响仍然知之甚少。这些方法的自引导性质是否会放大模型中的不良行为?我们在 108 个模型生物体上测试了七种一致性训练方法:开源模型 (7B--70B) 经过微调,以表现出各种形式的受控错位行为。我们发现结果差异很大:一致性训练通常会抑制 奖励作弊 和出现的偏差,但会放大阿谀奉承。我们提出的证据表明,由一致性标记过程引起的分布变化,而不是选择算子的变化,可能是系统对齐效应的主要驱动因素。最后,我们提出了一个统一的理论框架来推导一致性训练放大或抑制失调的条件。总的来说,我们的研究表明一致性训练不是对齐中立的,并且应该仔细审核它在关键系统中的使用。