论文
错误建议的不平等影响:使用训练数据归因来调节紧急偏差
The Unequal Influence of Bad Advice: Using Training Data Attribution to Modulate Emergent Misalignment
摘要
在狭窄的、错位的任务上对大语言模型进行微调可以取消其训练后的对齐并引发新的错位行为——这种现象被称为“紧急错位”(EM)。 EM 与类似角色的表征联系在一起,其中微调可能会通过放大有害或“邪恶”的角色来减少损失。目前尚不清楚训练数据的哪些属性会导致这种效应:是否所有有害示例对错位的影响大致相同,以及不同模型是否同样受到相同微调示例的影响。在这项工作中,我们使用训练数据归因来定量估计每个有害示例对 EM 的贡献程度。我们通过再训练对归因质量进行基准测试——良好的归因分数应该使我们能够通过过滤该分数的数据来增强或减弱 EM。基于分数的过滤可以显着增强或减弱 EM;我们发现数据归因分数和黑盒危害性分数都可以识别相应的例子。当我们在同一数据集上训练时,我们测试的所有模型都会变得不对齐,并且当从计算它们的同一模型中过滤数据时,影响分数表现最佳。我们从我们测试的三个模型系列派生的分数中发现影响分数的跨模型概括,但这种概括并不能恢复相同的模型过滤性能。