论文
与人物角色特征出现的不一致的数据归因
Data Attribution of Emergent Misalignment with Persona Features
摘要
紧急错位 (EM) 是一种现象,其中 微调 执行狭窄任务的语言模型会导致不相关领域的有害行为。一个领先的机械账户将 EM 归因于角色特征:在 预训练 期间获得的潜在方向,错位的 微调 会放大。我们询问这些特征从何而来:哪些 预训练 文档激活了它们,以及自然发生的人类书写文本是否足以引发 EM。使用基于稀疏自动编码器(SAE)的模型对四个开放权重模型进行比较,我们发现与越狱角色、讽刺、欺骗和操纵相关的特征因 微调 失准而被放大,而与安全相关和助理身份的特征则被抑制。引导各个特征在两个方向上控制 EM:它会导致对齐模型中高达 62% 的错位率(超过错位 微调 本身达到的 35%),并将错位模型重新对齐到接近基线的错位率。将因果特征归因于一百万个 预训练 网络文档的语料库,可以检索有关邪恶角色、统治和有害机构的语义相关叙述。然而,即使在重新格式化为助手式响应之后,这些人工编写的文档上的 微调 也不能可靠地诱导 EM,而从相同内容派生的合成指令-响应对却可以,并且可以在模型系列之间转移。因此,仅语义相关性是不够的:响应结构或模型生成的措辞在诱导 EM 中发挥着重要作用。