论文

安全训练可调节 同策略 RL 下的有害错位,但方向取决于环境设计

Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

模型评测安全与风险评测

摘要

众所周知,强化学习 (RL) 下的规范游戏会导致 LLM 产生阿谀奉承、操纵或欺骗行为,但发生这种情况的条件仍不清楚。我们在 3 个环境中使用 同策略 RL 训练 11 个指令调整的 LLM (0.5B-14B),并发现模型大小在某些环境中充当安全缓冲区,但在其他环境中会导致更大的有害利用。受控消融将这种逆转追溯到特定于环境的特征,例如角色框架和隐含的游戏性线索。我们进一步表明,大多数安全基准都不能预测 RL 引起的错位,除非在利用依赖于推断用户偏好的谄媚分数的情况下。最后,我们发现 同策略 RL 保留了模型自身生成分布中固有的安全缓冲区,该缓冲区在 离策略 设置期间被绕过。