论文

奇怪的概括是非常脆弱的

Weird Generalization is Weirdly Brittle

模型评测安全与风险评测

摘要

奇怪的泛化是一种现象,其中对来自狭窄领域(例如不安全代码)的数据进行微调的模型会产生令人惊讶的特征,甚至在该领域之外也表现出来(例如广泛的错位)——先前的工作已将这种现象强调为关键的安全问题。在这里,我们提出了一项针对一系列扩展模型和数据集的关键奇怪泛化结果的扩展复制研究。我们确认,在某些情况下可能会出现令人惊讶(且危险)的特征,但我们发现奇怪的泛化异常脆弱:它仅针对特定数据集上的特定模型出现,并且在简单的训练时间、基于提示的干预下消失。我们发现最有效的干预措施提供了及时的背景,使普遍的行为成为预期的行为。然而,我们表明,即使是非常通用的干预措施,不能预见特定的普遍特征,仍然可以有效地减轻奇怪的普遍化的影响。因此,我们的研究结果有助于澄清奇怪的概括所带来的安全威胁的本质,并指出了一套易于实施的解决方案。