论文
过程优势信号整形:面向LLM推理器过程监督RL的范式无关中间件
Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners
摘要
组相对策略优化(GRPO)是LLM推理器过程监督强化学习的默认配方——而稠密过程监督——经学习型过程奖励模型(PRM)或自策略蒸馏KL信号——是增密其薄弱结果奖励的常见方式。但把这种步级信号叠加在GRPO的组标准化优势上暴露三种结构性病理:组标准化时汇集的过程、结果与格式流间的通道污染;过程信号粒度与被记账的逻辑决策粒度间的分辨率失配;以及GRPO的剩余回报求和依信号符号域而造成长度膨胀或截断探索的累积陷阱。我们提出PASS(过程优势信号整形)——位于任意标量步级过程信号与GRPO裁剪代理之间的紧凑中间件——依次解决三种病理:优势融合在每组内独立标准化三流;按值分块从信号自身导出值同质块并在块内广播信用;除以长度把累积目标转为平均价值密度分数。我们在两域两过程信号范式下验证PASS——数学推理上的学习型PRM与多跳问答上的自策略蒸馏KL信号(含广义变体)——以及两种组标准化算子。在每种机制中PASS较对应GRPO基线带来一致的pass@1增益。
