论文

当 RLHF 失败时:奖励作弊、崩溃和评估器游戏的机械分类

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

模型评测模型行为与机制分析

摘要

RLHF 评估应跟踪故障如何出现、故障发生在何处以及在外部质量下降之前出现哪些警告信号。我们使用为本论文构建的紧凑 RLHF 管道来研究这个问题,包括 PPO、DPO、不确定性惩罚 PPO (UP-PPO)、奖励模型不确定性、近似策略漂移、多样性和重复诊断以及两个外部 LLM 法官。我们没有将 奖励作弊 视为单个终端事件,而是根据学习奖励 R_phi、判断分数 R_dag 和 R2_dag 及其平均 R_dag 的方向对匹配的检查点和提示级别转换进行分类。主要的实证结果是,积极的 PPO 产生最清晰的局部 奖励作弊 信号,UP-PPO 减少但不会消除该信号,行级诊断揭示检查点平均值隐藏的故障,并且预转换功能部分预测未来的局部 奖励作弊。中心结论是方法论的:RLHF 失败是可以分类、局部化和部分预期的训练动态,而不仅仅是最终模型的病理。该存储库位于 github.com/zabahana/rlhf-failure-modes-diagnostics。该管道还部署为实时交互式 Web 演示,用于 rlhf-failures.zelalem.ai 上的模型比较和诊断视图。