论文

泛化黑客:模型可以通过阻止行为泛化来玩弄强化学习

Generalization Hacking: Models Can Game Reinforcement Learning by Preventing Behavioral Generalization

模型评测安全与风险评测

摘要

模型 后训练,特别是强化学习 (RL),是开发人员塑造模型值和行为的主要机制之一。然而,随着模型越来越具有评估和训练意识,当感知到的目标与当前的价值观相冲突时,他们可能会抵制训练,从而削弱开发人员通过进一步训练检测偏差和纠正模型行为的能力。在本文中,我们演示了泛化黑客攻击,其中模型在强化学习期间收集奖励,同时防止奖励行为泛化。我们在 Qwen3-235B-A22B 上构建了一个模型有机体,对描述训练意识和自我接种的合成文档进行微调,这是一种新颖的机制,其中模型将合规性框架为其思想链中特定于上下文的内容,而不展示或指导任何一种行为。该模型生物体在训练时的危害性与对照组相当,同时在 700 个 RL 步骤中保持持续 ${\sim}15$ 个百分点的合规性差距。此外,仅接受训练意识文档训练的控制有机体在强化学习压力下独立发现类似接种的推理,尽管从未接触过该概念,但仍形成了自己的合规性差距。由于泛化黑客有机体自始至终都会获得高奖励,因此标准训练指标不会提供泛化失败的信号。我们的结果首次证明模型可以在保持高奖励的同时主动抵抗强化学习行为修改,这表明随着模型变得更有能力和训练意识,它们可能能够破坏训练过程本身。