论文

鲁棒偏好建模的上下文奖励适应

In-Context Reward Adaptation for Robust Preference Modeling

模型训练奖励建模与过程监督

摘要

基于人类反馈的强化学习 (RLHF) 通常依赖于静态奖励模型来使 大语言模型 与人类偏好保持一致。然而,人类价值观本质上是多样化和异质的,单一的奖励模型通常缺乏泛化到看不见的偏好领域所需的稳健性。虽然现有的多重奖励框架试图解决这个问题,但它们通常仅限于一组固定的已知领域,并且无法在不进行昂贵的再培训的情况下适应看不见的人类分布。在这项工作中,我们提出了上下文奖励适应,这是一个基于 Transformer 的框架,旨在动态模拟多样化且看不见的人类偏好。通过利用 Transformer 的上下文学习功能,我们的方法可以从一小组偏好演示中自适应地推断出潜在的奖励结构。我们通过表征 真值 的渐近偏差来证明,虽然标准 Transformer 架构不足以完成此任务,但将人类响应时间作为辅助输入信号使模型能够成功适应以前未见过的领域的偏好。我们的研究结果表明,这种方法为偏好建模提供了更强大的基础,允许表示异构奖励和偏好分布变化,并为更灵活的人类人工智能对齐提供可扩展的路径。