论文

从好奇到谨慎:以悲观态度缓解 奖励作弊 的 Best-of-N

From Curiosity to Caution: Mitigating Reward Hacking for Best-of-N with Pessimism

模型推理推理验证与自校正

摘要

推理时计算扩展已成为提高各种任务的语言模型性能的强大范例,但如何最好地使用额外计算的问题仍然悬而未决。一种流行的方法是 BoN 采样,其中生成 N 个候选响应,根据奖励模型进行评分,然后选择得分最高的响应。虽然这种方法可以提高性能,但它很容易受到 奖励作弊 的影响,随着 N 的增加,性能会下降,因为选择的响应利用了奖励模型中的缺陷,而不是真正提高了生成质量。之前通过更强的奖励模型或严厉的分布正则化来缓解 奖励作弊 的尝试要么无法完全解决过度优化问题,要么过于保守而无法利用额外的计算。在这项工作中,我们探索了强化学习中的悲观主义原理,即使用价值估计的置信下限来避免奖励估计不确定的 OOD 行为。我们的方法被称为“谨慎”,可以被视为好奇心的反面:好奇心奖励预测错误作为新颖性的信号,而谨慎则惩罚预测错误作为分布不确定性的信号。实际上,谨慎训练了典型响应的错误模型,并使用其预测误差来降低非典型响应的奖励估计。我们广泛的实证评估表明,谨慎是一种简单、计算高效的方法,可以大大减轻 BoN 抽样中的 奖励作弊 的影响。我们还在简化的线性设置中提供了理论分析,这表明与标准 BoN 方法相比,谨慎性得到了改善。总之,我们的结果不仅确立了谨慎作为 奖励作弊 的实用解决方案,而且还提供了证据,证明基于好奇心的方法可以成为 LLM 设置中的通用 OOD 检测技术。