论文
浅层信念:合成文档微调无法抵御来自奖励黑客行为的新兴对齐失准
Shallow Beliefs: Synthetic document finetuning does not inoculate against emergent misalignment from reward hacking
摘要
近期研究表明,学习在强化学习环境中进行奖励黑客行为的模型可能产生广泛的对齐失准,而将奖励黑客视为可接受行为进行训练(即接种提示,IP)可阻止这种泛化。我们探究合成文档微调(SDF)是否能有效抵御未来未干预训练中的此类失准。我们在模型中训期间加入描述奖励黑客为可接受行为的合成文档,随后在可利用环境中用强化学习训练模型,使其学会奖励黑客行为。从行为上看,中训练阶段成功:模型对奖励黑客行为持积极态度,并更倾向于认可其生成的奖励黑客输出。然而,这些模型在学习奖励黑客后表现出显著的对齐失准(EM),而相同设置下采用IP则能防止EM的发生。我们发现,SDF在引入新关联时能可预测地引导下游泛化,但在覆盖已有关联(如奖励黑客与对齐失准之间的关联)时表现不佳且效果不可预测。实验结果表明,在我们测试的规模下,SDF可能使模型在表象上符合期望信念,但会以不可预期的方式引导其后续训练的泛化行为。