论文
通过改变理性程度缓解RLHF中的认知偏差
Mitigating Cognitive Bias in RLHF by Altering Rationality
摘要
我们怎样才能使模型对不完美的人类反馈具有鲁棒性?在基于人类反馈的强化学习 (RLHF) 中,人类对模型输出的偏好用于训练奖励模型,该模型为响应分配标量值。因为这些奖励是从成对比较中推断出来的,所以这种学习取决于潜在奖励差异和观察到的偏好之间的假设关系,通常使用玻尔兹曼公式进行建模,其中理性参数 beta 告知偏好如何一致地反映奖励差异。在实践中,β 通常被视为反映假定的统一注释器可靠性的固定常数。然而,人类反馈在实践中并不是这么简单:真正的人类判断是由认知偏差决定的,导致与上下文中出现的奖励一致行为的系统性偏差。为了解决这个问题,我们将理性视为上下文和注释相关的。我们设计了一种在奖励学习期间动态调整合理性参数 beta 的方法,使用LLM作为法官来评估可能存在的认知偏差。这种方法有效地降低了可能反映偏见或不可靠判断的比较的权重。根据经验,我们表明,即使在对具有强烈偏差偏好的数据集进行微调时,这种方法也可以学习更合理的下游模型。
