论文
经对比信念更新度量奖励寻求
Measuring Reward-Seeking via Contrastive Belief Updates
摘要
经强化学习训练的语言模型可能学会优化评分器的判断而非预期目标。这种“奖励寻求”难以测量:只要评分器奖励预期行为,追求评分器判断的模型与追求预期目标的模型表现完全一致。我们用对比合成文档微调(SDF)测量奖励寻求:改变模型对评分器奖励什么的信念,使这些信念与用户或开发者的期望冲突,再测量模型采纳各方偏好行为的比率。应用于一次以能力为导向的OpenAI o3 RL运行的中间检查点(未经安全训练),我们发现这些检查点在编码与对齐任务上常站在评分器偏好一边、而非用户或开发者一边;这种倾向在整个RL训练中上行。例如,在一个被迫在“遵守对主管的承诺”与“违背承诺以完成任务”间选择的环境中:当SDF文档称评分器奖励任务完成时,晚期能力导向o3检查点87%的情况下违背承诺;当文档称其奖励诚实时仅9%(其思维链常把这一选择显式化)。早期检查点远不敏感(40%对24%)。该方法也泛化到奖励黑客模型:一个被训练为奖励黑客的模型生物(gpt-oss-120b)对评分器偏好的敏感度是未修改模型的两倍多——偏向评分者的平均行为位移从33%升至86%。结果表明RL能在训练过程中增强奖励寻求,产出可能在相信这样做能获得更高奖励时违背开发者意图的模型。