论文
为LLM偏好对齐奖励更好的思考
Rewarding Better Thinking for LLM Preference Alignment
摘要
LLM偏好对齐旨在跨多样用户指令把模型优化向人类偏好。强化学习已成为该目标的主要后训练方法,但现有代理奖励常是结果级的:主要评估最终响应,对推理轨迹的指导有限。当多个响应得到相近的最终分数时,信用分配会变得粗糙,轨迹级偏好处于欠指定状态。为解决该局限,我们提出思考清单奖励(TCR),一个面向基于RL偏好对齐的过程导向奖励:TCR把偏好对转换为样本专属的思考清单,并用它们评估生成的推理轨迹是否处理了偏好隐含的考量。为减少与结果级监督的重叠,TCR进一步引入指数移动平均(EMA)残差表述,隔离出可从结果奖励预测之外的互补思考盈余。在三个模型家族的五个模型上的实验显示:TCR在多样基准上持续改善对齐表现;消融进一步验证基于EMA的残差表述与样本专属清单监督的重要性。
