论文
错位有其个性:突发错位的大五解释
Misalignment Has a Personality: A Big Five Account of Emergent Misalignment
摘要
微调 数据语言模型包含狭隘缺陷,例如不安全的代码或不正确的数学答案,可能会通过仍在争论的机制导致广泛的错位。我们提供了一个可解释的解释:在我们研究的模型和语料库中,失调的行为就像人格的转变。先前的工作从单个二元对比中提取性格特征的激活方向,这可以在不建立校准尺度的情况下分离或引导行为。相反,我们使用分级的三级干预来提取大五人格的人格向量,并在两个开放权重模型上对其进行验证。三个水平线性排序,Cohen's d 值高达 6.2;向量将零样本和特定特征转移到独立的语料库;它们的效果在中层频带内最强。应用于训练数据时,这些向量显示,八个领域的错位语料库具有共同的“大五”特征:较低的宜人性和责任感,以及较高的外向性和神经质。两个模型均恢复了该特征,相关性为 r = 0.94。 微调 印记相同的配置文件,沿着相应的签名移动模型的世代,使用基于激活的测量 r = 0.83,使用基于文本的判断 r = 0.90,同时还使用 r = 0.69 移动内部激活。同样的向量将阿谀奉承的特征描述为高度外向性和低责任性,而不是过度随和性,这是单一方向无法捕捉到的区别。校准后的个性向量将不透明的安全现象转化为人类可读的诊断特征。