论文

泛化的搭载假说:解释和减轻紧急偏差

The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment

模型训练监督微调与指令调优

摘要

LLM 在训练示例之外的广泛过度概括背后的机制仍不清楚。紧急错位(EM)提供了一个引人注目的案例研究:对狭窄任务的微调会导致与语义不相关的测试领域的广泛错位。在这项工作中,我们提出了搭载假设:聊天模板词元可以将微调的行为搭载到域外查询上。我们通过显示对前缀(所有用户查询之前的标记)的细微扰动,或使用未微调模型中的前缀表示来修补前缀表示,可以在不更改用户查询的情况下恢复对齐,从而验证了这一假设。基于这一发现,我们提出了词元正则化微调(TReFT),它在训练期间规范特定的词元表示以减轻 EM。在不同的模型和多个引发 EM 的数据集上,TReFT 减少了 EM,同时保留了域内学习。在法律领域进行微调的 Llama-3.1-8B 上,TReFT 比保留一组对齐示例的数据交错实现了 33.5% 的 EM 减少。我们进一步表明,TReFT 扩展到其他窄微调设置,包括弃权、工具使用和拒绝(偏离主题泛化平均减少 54.3%),支持 Piggyback 假设。总的来说,我们的工作强调 LLM 可能会以意想不到的方式学习和泛化,并提出了一条通向更受约束的微调的道路。它还要求进一步研究共享输入特征如何搭载跨域的模型行为。