论文
道德推理训练有帮助还是有害?红队 RL 训练有素的道德特工进行人格面具攻击
Does Moral Reasoning Training Help or Hurt? Red-Teaming RL-Trained Ethical Agents with Persona Attacks
摘要
道德奖励强化学习可以使语言模型代理更加合作,但这种一致性是否能经受住对抗性角色压力尚不清楚。这种攻击是现实的:检索到的上下文、工具输出或多轮框架都可以注入与代理的道德目标相竞争的角色指令。我们对红队的 Gemma-2-27B/9B 和 Llama-3.1-8B 代理进行了五种角色攻击的道德训练,然后通过噪声奖励控制、对抗性 PPO、表示分析、转向和头部切除来探究因果关系。在 27B 时,道德 RL 削减意味着对抗性下降 5.2 倍,但道德准确性成本约为 11pp;在 205 个场景和 5 个种子中,推理级道德奖励产生 5.8 倍的鲁棒性,而匹配的随机奖励则不会产生任何鲁棒性。训练还重塑了表示几何结构(平均 CKA 为 0.82/0.83,噪声为 0.98),将峰值攻击处理提前 8 层,并暴露了可恢复完整 PPO 平均鲁棒性 83% 的 1 级 L21 方向。一种故障模式可以解决所有这些问题。与小说角色扮演相比,L21 转向仅恢复了 29% 的间隙,头部消融发现 38 个顺从头与 25 个对准头竞争。因此,道德强化学习建立了部分线性、部分电路分布式的鲁棒性,可通过激活控制进行转移,但仍会被命名角色角色扮演所击败。