论文

用值表示预测对齐泛化

Predicting Alignment Generalization with Value Representations

模型评测模型行为与机制分析鲁棒性、公平性与可信度评测

摘要

LLM 开发人员对他们的模型进行后训练,以展示亲社会价值观和行为特征,这些都在对齐目标中列举。然而,虽然最近的训练后发展已经产生了在一致性评估上得分很高的模型,但针对狭隘行为集的训练模型仍然以意想不到的方式影响他们在不可见的上下文和环境中的行为。在本文中,我们建立了对齐泛化预测的任务,即预测微调模型以遵循给定值如何改变其在广泛的保留值中的行为。我们对现代对齐目标中发现的 66 个值的对齐泛化效果进行了大规模分析,并对对齐泛化预测任务的表征技术进行了基准测试。我们发现,在上下文中应用值时,基于模型激活的表示明显优于基于值的文本描述的方法。具体来说,最好的基于激活的方法与我们的泛化矩阵的相关性达到 0.45,而来自我们的泛化矩阵的相关性为 0.05。 基于描述的基线。然后,我们通过使用它们来测量多值对齐目标中的值的相似程度来展示预测对齐泛化到下游任务的表示的适用性,我们发现这与模型的鲁棒性显着相关。最后,我们展示了共享的、独立于模型的价值空间的初步证据,我们用它来开发基于经验泛化动力学的 LLM 价值的第一个分类法。我们的工作证明了研究LLM价值泛化的重要性及其在模型行为的更实证设计和训练中的应用。