论文

关于 RLVR 后训练的语言漂移

On Language Drift during RLVR Post-Training

模型评测模型行为与机制分析

摘要

LLM 推理模型的最新进展——主要由通过可验证奖励的强化学习(RLVR)进行后训练范式驱动——使他们能够完成令人印象深刻的复杂任务。然而,在能力不断提高的同时,大语言模型在其思维链(CoT)中也越来越多地表现出语言漂移的迹象:不寻常、不标准和看似无意义的语言使用。尽管它有充分的记录——并且可能会损害 CoT 的可监控性——但迄今为止,人们对语言漂移的原因知之甚少。在本文中,我们确定了语言漂移发生的条件:我们从理论上证明 RLVR 优化压力允许无限制的语言漂移,而监督微调则不允许。然后,我们凭经验证明,语言漂移特别出现在 RLVR 执行新颖推理任务的过程中——即。当目标行为无法从基本模型中提取出来时。最后,我们证明,在不限制预期奖励的情况下不可能限制语言漂移,这表明不能在不损害前沿 RLVR 后训练期间性能的情况下提高 CoT 可监控性。