论文

通过数据中介传输的视角发现突发和潜意识的错位

Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer

模型评测安全与风险评测

摘要

微调 LLM 在狭窄的有害数据集上可能会引发紧急错位 (EM),其中模型表现出的错位行为远远超出了 微调 分布。我们认为,紧急的错位可以更好地理解为一种数据介导的转移现象:有害的 微调 示例不会引起统一的行为溢出,而是与数据集的结构属性以及相对于模型的任务难度相互作用。在我们的实验中,我们发现,当 微调 和评估提示具有相似的底层功能结构时,当提示为连贯的有害完成留下更多空间时,以及当模型更可靠地学习目标行为时,更容易出现错位。训练流程本身也很重要:预训练的组合会导致后来的错位。我们进一步研究潜意识学习(SL),其中 微调 在有害教师生成的看似良性的数据上传输错位。超越标准 SFT 设置,我们首次比较了 离策略 和 同策略 蒸馏 下的这种传输,使我们能够将教师指导和训练数据分布在传输偏差中的作用分开。总之,这些结果支持了以数据为中心的观点:突发/潜意识错位不应被视为孤立的有害 微调 示例的简单结果,而应被视为 微调 数据结构、预训练分布和训练通道之间相互作用的结果。