论文
开始分类:LLM 强化学习的分类批评
Start Classifying: Categorical Critics for LLM Reinforcement Learning
摘要
大语言模型 的近端策略优化 (PPO) 通常通过标量值目标的均方误差 (MSE) 回归来训练其批评者。尽管标量 MSE 在估计条件预期回报方面在统计上是有效的,但具有可验证奖励的强化学习 (RLVR) 中的稀疏二元奖励使得批评优化和校准尤其重要:小值误差直接扭曲了 PPO 使用的标量优势。我们研究基于分类的训练目标是否可以改善这种批评信号。 HL-Gauss PPO 用基于离散值支持的分类预测器取代了标量 MSE 头,并通过针对平滑 HL-Gauss 目标的交叉熵进行训练。其输出被解码为标准 GAE 和 PPO 的标量期望;因此,actor 更新没有改变,也不是分布式的。在数学推理、工具增强数学和 Search-R1 方面,以及在 Qwen2.5 和 Qwen3 主干上,HL-Gauss PPO 始终优于强大的 PPO 和 DAPO 基线。使用单热、双热和伯努利双箱批评的控制表明,较大的输出头和二元分类都无法单独解释收益。在推理前缀的常见集合上,HL-Gauss 改进了 Brier 分数和校准误差,并产生更对称、更低方差的优势。这些结果将分类价值学习定位为 RLVR 中 PPO 批评者的有效优化替代品。