论文

如何对代理进行后期训练:包络采样可减少奖励黑客行为

How to post-train on a surrogate: Envelope sampling mitigates reward hacking

模型训练模型评测强化学习奖励建模与过程监督安全与风险评测

摘要

大型语言模型(LLM)通常是针对 LLM 法官和其他廉价替代者进行​​后训练的,因为真正的奖励(例如人类偏好)对于大规模查询来说太昂贵了。这种做法通常会导致奖励黑客攻击,针对错误校准的代理进行强化学习会导致不良的副作用。在这项工作中,我们研究了一种设置,其中少量 $n$ 模型输出用真实标签(例如,来自专家评审)进行注释,并用于在针对 LLM 判断进行优化之前重新校准 LLM 判断。先前判断重新校准的方法成本高昂或具有启发性,并且众所周知,当代理在一组罕见的输出上被错误校准时,策略采样就会失败。在这项工作中,我们提出了包络采样,这是一种基于理论的法官重新校准方法,旨在最小化训练后模型的遗憾上限,假设人类奖励和重新校准的奖励位于法官周围的 $L^2$ 球中。我们提供实用的算法,通过拒绝或微调来从包络中采样 修改后的奖励,以及临床记录生成和受控阿谀奉承任务的实验表明,对信封样本进行重新校准可以减轻奖励黑客攻击,而对基本模型样本进行重新校准则不能。