论文

通过改变理性程度缓解RLHF中的认知偏差

Mitigating Cognitive Bias in RLHF by Altering Rationality

模型训练奖励建模与过程监督

摘要

我们怎样才能使模型对不完美的人类反馈具有鲁棒性?在基于人类反馈的强化学习 (RLHF) 中,人类对模型输出的偏好用于训练奖励模型,该模型为响应分配标量值。因为这些奖励是从成对比较中推断出来的,所以这种学习取决于潜在奖励差异和观察到的偏好之间的假设关系,通常使用玻尔兹曼公式进行建模,其中理性参数 beta 告知偏好如何一致地反映奖励差异。在实践中,β 通常被视为反映假定的统一注释器可靠性的固定常数。然而,人类反馈在实践中并不是这么简单:真正的人类判断是由认知偏差决定的,导致与上下文中出现的奖励一致行为的系统性偏差。为了解决这个问题,我们将理性视为上下文和注释相关的。我们设计了一种在奖励学习期间动态调整合理性参数 beta 的方法,使用LLM作为法官来评估可能存在的认知偏差。这种方法有效地降低了可能反映偏见或不可靠判断的比较的权重。根据经验,我们表明,即使在对具有强烈偏差偏好的数据集进行微调时,这种方法也可以学习更合理的下游模型。

通过改变理性程度缓解RLHF中的认知偏差:论文配图
图 1:减少微调LLM认知偏差的干预流程概述。人类会根据提示提供偏好,例如“琳达是银行出纳员”的例子。然后,LLM会判断每个配对的提示和响应是否可能受到认知偏差 (DfD_{f}) 的影响。根据这个测量值,我们计算出 β\beta 的动态值。这些提示、响应和 β\beta 值用于学习奖励模型并微调LLM。较高的偏差 = 较低的 β\beta 值。