论文

S2T-RLHF:面向稳定偏好RLHF的分层信用分配

S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF

模型训练强化学习

摘要

带偏好奖励模型的基于人类反馈的强化学习(RLHF)常表现出不稳定的训练动态。一个关键因素是:标准RLHF依赖单一序列级标量奖励,该奖励被传播到token级策略更新,使响应内部的信用分配天然含糊。近期工作尝试把奖励细化为更密的token级监督来解决该问题,常依赖“更细粒度的信用分配改善优化”这一隐含假设。我们认为该假设不完整:当偏好信号带噪且仅在响应级定义时,过度细粒度的奖励细化会放大奖励不确定性、动摇学习。为解决该问题,我们提出分层信用分配的粒度感知原则:强调面向稳定性的奖励设计而非最大分配精度。在该原则下,句子是自然的中间粒度:兼顾语义连贯与对token级噪声的稳健。依此视角,我们提出S2T-RLHF——一个句子到token的奖励分解框架:先把序列级偏好奖励分配到句子,再在句内施加有界的token级细化,无需奖励模型重训练或token级监督。跨多个数据集与优化设置的实验显示,S2T-RLHF在保持有竞争力的偏好对齐的同时,改善训练稳定性与稳健性。

S2T-RLHF:面向稳定偏好RLHF的分层信用分配:论文配图
图 1:S2T-RLHF 概述。全局序列级奖励首先通过句子间讨价还价分解为句子级信用(第一阶段),然后通过狄利克雷后验推理细化为令牌级奖励(第二阶段),从而在不修改奖励模型的情况下在 RLHF 中实现稳定且可解释的信用分配。