论文
奇怪的概括和紧急错位的威胁模型
On the Threat Model of Weird Generalization and Emergent Misalignment
摘要
在小型、特定领域的数据集上缩小 微调 可以使模型行为产生广泛且令人惊讶的变化,这种现象称为怪异泛化(WG)。然而,目前尚不清楚 微调 数据的哪些特征对于 WG 的出现是必要的。在这里,我们通过研究一系列看似相关的特征来解决这个问题,包括数据集大小、组成、语言、呈现风格以及相对于模型参数知识的新颖性。此外,由于工作组评估依赖于评估泛化程度的小问题集,因此我们还分析了这种测量对所使用的问题集的敏感程度。在四个数据集上使用三个开放权重模型进行的实验表明,WG (1) 的程度在很大程度上取决于数据集组成和语言(而不是大小); (2) 预训练中熟悉的数据比新数据更大; (3) 对所使用的评估问题集敏感。总的来说,这些结果表明 WG 是训练和评估数据的非常脆弱的特性的产物。因此,我们认为 WG 更可能作为一种对抗性威胁(需要仔细的数据工程),而不是作为常规 微调 固有的重大危险。