论文

EvalStop:使用世界反馈来检测和纠正多租户 RLHF 平台中的奖励过度优化

EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

AI 基础设施分布式训练基础设施

摘要

云 LLM 微调 平台越来越多地服务于 RLHF 工作负载,其中学习奖励模型被优化为人类质量的代理。正如高等人。 (2023)表明,在持续的优化压力下,该代理偏离了世界反馈(下游评估指标),这种现象称为奖励过度优化。现有的平台调度程序忽略了这种差异:非透视调度程序在没有任何质量信号的情况下优化 JCT,SLAQ 风格的质量感知调度程序使用训练损失(一种较弱的代理,通过黑客攻击单调下降),而经典的按作业提前停止需要人工监控,并且不会释放共享 GPU。我们提出了 EvalStop,一种可组合的调度原语,它在 k 个连续的 eval 分数下降时终止作业,释放 GPU,保留最佳检查点,并委托给任何基本调度程序。我们将调度程序级别的早期停止视为一个检测问题,并在离散事件模拟器中对其进行评估,该模拟器的 RLHF 工作负载混合了 奖励作弊 和结构健康的运行,并且 真值 标签对调度程序隐藏。在 RLHF 繁重的工作负载(80% RLHF、64 个 GPU)上,EvalStop 实现了 98% 的精度/99% 的召回率/1.5% 的 FPR,同时与 SRTF-Est 相比,JCT 提高了 9%,计算浪费减少了 22%(p<0.05)。琐碎的固定进度和损失稳定的竞争对手要么在健康的 RLHF 上遭受 65% 的 FPR,要么错过一半以上的真实黑客案例。测试的每个基本调度程序的增益 (9-25% JCT) 和检测质量在评估噪声(噪声标准 <= 0.05 时精度至少为 91%)和黑客基础率(在 20-80% 黑客分数中精度至少为 89%)下保持稳定。