论文

LLM任务适配如何重塑对齐:行为与表征漂移的多维度研究

How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift

模型评测模型训练强化学习模型行为与机制分析RLVR

摘要

后训练是将大语言模型适配到下游任务的关键机制。尽管先前研究表明任务适配会改变模型既有的对齐特性,尤其是安全行为,但其在对齐各领域上的更广泛影响仍知之甚少。我们系统评估了代表性任务适配方法,包括监督微调(SFT)、KL正则化SFT与可验证奖励强化学习(RLVR),覆盖安全、事实性、立场稳定性、社会危害、可控性与指令遵循六大关键领域的15个对齐方面,以弥补这一空白。结果表明,后训练对对齐的重塑并不均匀。RLVR在提升任务性能的同时引起相对较小但非零的、随指标而异的偏移,而SFT则在各领域导致大得多的对齐漂移。KL正则化可缓解这一效应:更强的参考模型锚定能减少相对基线的对齐漂移,但KL-SFT在对齐保持方面仍不及RLVR。表征层面的分析进一步支持这一模式:与对齐相关的表征偏移与行为漂移相吻合。综合来看,这些结果表明任务适配不仅是提升能力的步骤,其本身就是一种对齐干预,这促使我们应将多维对齐评估作为后训练流水线的标准组成部分。

LLM任务适配如何重塑对齐:行为与表征漂移的多维度研究:论文配图
图 2:相对于指令调整基线的对齐漂移,在 SFT 和 RLVR 的训练域中取平均值。每个单元格报告指标值的改进(以百分点为单位)。着色显示了符号对齐的变化,蓝色表示改善,红色表示退化。为了便于阅读,颜色被剪裁为 ±6\pm 6pp。