论文
通过迭代 DPO 诱导奖励作弊出现紧急偏差
Inducing Emergent Misalignment from Reward Hacks with Iterative DPO
摘要
奖励作弊 在可验证奖励(RLVR)的强化学习过程中可能会导致语言模型中的奖励寻求和广泛的错位。研究这种错误概括对于开发更好的威胁模型和对策非常重要,但由于大型模型上强化学习的成本,通常是不可行的。作为替代方案,我们建议研究迭代 DPO 中的紧急错位,这保留了 RLVR 的重要属性,同时降低了成本并支持对流行的微调 API 进行训练。在实践中,我们发现在单轮 奖励作弊 环境上使用迭代 DPO 训练 GPT-4.1 会引起隐蔽的未对准功率搜索和对准伪造,这是第一个公开可用的(半)在线训练管道,可引起这些相关形式的未对准。我们还发现,使用相同的管道训练 Qwen2.5-32B-Instruct 会引起错位,并提高指令跟随精度,这表明迭代 DPO 可以用作选择性泛化的测试平台。总体而言,我们认为迭代 DPO 可以帮助民主化并加速 RLVR 中出现的突发失调的研究。