论文

为LLM偏好对齐奖励更好的思考

Rewarding Better Thinking for LLM Preference Alignment

模型训练奖励建模与过程监督

摘要

LLM偏好对齐旨在跨多样用户指令把模型优化向人类偏好。强化学习已成为该目标的主要后训练方法,但现有代理奖励常是结果级的:主要评估最终响应,对推理轨迹的指导有限。当多个响应得到相近的最终分数时,信用分配会变得粗糙,轨迹级偏好处于欠指定状态。为解决该局限,我们提出思考清单奖励(TCR),一个面向基于RL偏好对齐的过程导向奖励:TCR把偏好对转换为样本专属的思考清单,并用它们评估生成的推理轨迹是否处理了偏好隐含的考量。为减少与结果级监督的重叠,TCR进一步引入指数移动平均(EMA)残差表述,隔离出可从结果奖励预测之外的互补思考盈余。在三个模型家族的五个模型上的实验显示:TCR在多样基准上持续改善对齐表现;消融进一步验证基于EMA的残差表述与样本专属清单监督的重要性。

为LLM偏好对齐奖励更好的思考:论文配图
图 3:TCR 训练流程概述。首先根据成对数据构建特定于样本的思维清单,然后根据它评估生成的推理轨迹以获得基于清单的奖励。然后,该奖励被残差化,并与结果级别奖励和格式奖励相结合,产生用于策略优化的整体训练奖励。