论文

RLHF 中奖励不确定性的统一视角

A Unifying Lens on Reward Uncertainty in RLHF

模型训练奖励建模与过程监督

摘要

来自人类反馈的强化学习 (RLHF) 受到 奖励作弊 的瓶颈,其中该策略利用代理奖励模型 (RM) 中的错误并产生高 RM 分数,但没有真正的质量增益。一种自然的缓解方法是悲观:降低 RM 不确定的区域的奖励。然而,标准标量 RM 不提供不确定性的原则概念。我们认为正确的对象是分配奖励模型 $p(r\mid x,y)$。在贝叶斯推理或 KL 分布鲁棒优化 (KL-DRO) 镜头下,KL 正则化 RLHF 目标承认封闭形式有效奖励 $\tilder r(x,y) = \pmβ\log\mathbb{E}_p[e^{\pm r/β}]$。悲观分支统一了 RM 集成聚合的先验启发法:均值聚合、最坏情况优化 (WCO) 和不确定性加权优化 (UWO) 都作为该单个表达式的限制或截断出现。这也澄清了每条现有规则的隐含假设。