论文

过程优势信号整形:面向LLM推理器过程监督RL的范式无关中间件

Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

模型训练强化学习RLVR

摘要

组相对策略优化(GRPO)是LLM推理器过程监督强化学习的默认配方——而稠密过程监督——经学习型过程奖励模型(PRM)或自策略蒸馏KL信号——是增密其薄弱结果奖励的常见方式。但把这种步级信号叠加在GRPO的组标准化优势上暴露三种结构性病理:组标准化时汇集的过程、结果与格式流间的通道污染;过程信号粒度与被记账的逻辑决策粒度间的分辨率失配;以及GRPO的剩余回报求和依信号符号域而造成长度膨胀或截断探索的累积陷阱。我们提出PASS(过程优势信号整形)——位于任意标量步级过程信号与GRPO裁剪代理之间的紧凑中间件——依次解决三种病理:优势融合在每组内独立标准化三流;按值分块从信号自身导出值同质块并在块内广播信用;除以长度把累积目标转为平均价值密度分数。我们在两域两过程信号范式下验证PASS——数学推理上的学习型PRM与多跳问答上的自策略蒸馏KL信号(含广义变体)——以及两种组标准化算子。在每种机制中PASS较对应GRPO基线带来一致的pass@1增益。

过程优势信号整形:面向LLM推理器过程监督RL的范式无关中间件:论文配图
图 2:对于表 4 的四种 Masked-Norm 配置,HotpotQA 在一个训练时期内的训练时间平均推出长度(以令牌为单位)。左:OPD — GRPO(+OPD) 与 PASS + OPD。右:G-OPD—GRPO(+G-OPD) 与 PASS + G-OPD。所有四次运行均从同一参与者开始,推出长度约为 180180 个词元。两次基线运行向下漂移至 115115-135135 个令牌,而两次 PASS 运行向上漂移至 235235-260260 个令牌。该数字报告了推出时间令牌,并且是对表 8 中的部署时间令牌计数的补充。