论文

强化学习可以放大无害奖励带来的紧急偏差

Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards

模型评测安全与风险评测

摘要

紧急错位 (EM) 是语言模型在 微调 之后在小范围错位示例上变得广泛错位的令人惊讶的趋势。虽然 EM 已在有监督的 微调 (SFT) 设置中得到了广泛研究,但它也源自强化学习 (RL) 的证据仅限于大型闭源模型,使得该现象的研究成本高昂且难以重现。我们在小型、现成的开放权重模型中沿三个轴描述来自 RL 的 EM。首先,我们表明,奖励狭窄的、明显错位的行为会比样本匹配的 SFT 产生更高的一般域错位。其次,我们证明来自强化学习的 EM 可以由看似自然产生的奖励信号诱导,例如不受欢迎的审美偏好或糟糕的修辞吸引力。第三,我们评估了针对 SFT 引发的 EM 开发的训练中缓解措施,发现它们广泛转移,通过角色向量进行预防性指导、交错安全数据和接种促使一切都表现良好。