论文
辩论训练减少了 RLAIF 中的 奖励作弊
Debate Training Reduces Reward Hacking in RLAIF
摘要
我们证明,与基于 AI 反馈的强化学习 (RLAIF) 基线相比,RL 使用辩论(由较弱的 LLM 法官裁决的生成器和评论家之间的两人对抗游戏)对 LLM 进行微调,减少了 奖励作弊。 奖励作弊 是 RLAIF 的一个核心障碍:随着训练的进行,策略学会利用人工智能判断中的系统错误,从而降低任务绩效,当判断能力弱于策略时,这个问题就会恶化,而这种设置与监督能力日益增强的人工智能系统最相关。我们研究数学任务,最终答案的正确性是可验证的,使我们能够测量 奖励作弊 动态。我们用一个冻结的、较弱的 Gemini~2.5 Flash Lite 法官训练 Gemini~2.5 Flash 级策略,将单人 RLAIF 基线与辩论进行比较。虽然基线很快就攻击了法官,但辩论在整个训练过程中保持了法官的表现,从而在许多 RL 步骤中保持更高的峰值验证准确性(恢复了 45% 的性能差距)。额外的实验表明:1)进一步削弱法官会导致更快的黑客攻击,但这可以通过增加额外的辩论轮次来弥补; 2)辩论激励因素凌驾于提示偏差之上; 3)使用 LLM 判断的 RL 的训练/验证奖励差距比来自可验证奖励的 RL 更小; 4)学习使用 真值 标签进行批评以说服法官是可能的,但速度很慢。总而言之,我们的结果是对辩论可行性的积极更新,同时强调平衡多智能体训练至关重要:如果没有玩家限制,对抗性训练就有可能默认批评家判断黑客。我们表明,批评字数限制(有效最多 150 个字)成功地平衡了游戏并避免了法官黑客攻击,尽管这会限制批评家表达清晰度,从而带来权衡。