论文

正确即强大:调整经过验证的隐藏状态增强强化学习推理能力

Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

模型训练强化学习

摘要

可验证奖励的强化学习 (RLVR) 已成为改进 大语言模型 中数学推理的主要方法,但当前的方法将每个正确的执行轨迹减少到单个奖励位,忽略了隐藏状态之间共享的几何结构。研究这个结构,我们发现在锚标记(答案标记之前的位置)处,正确的执行轨迹自然收敛,因为它们必须产生相同的答案(余弦相似度~0.84),但每个都保留来自其独特推理路径的残余方差。在这一点上鼓励完全对齐会推动模型提取统一的“正确决策”表示,从而降低对所采取的推理路径的敏感性。基于这一观察,我们提出了 Hidden-Align,这是一种辅助损失函数,可在 RL 训练期间在锚标记处对齐正确执行轨迹的最后一层隐藏状态,并且训练和推理的开销为零。在八个数学推理基准测试中,Hidden-Align 在 Qwen3-1.7B、4B 和 14B 上分别将 DAPO 基线上的平均 pass@1 提高了 3.8、6.2 和 5.4 个百分点,在所有三个尺度上都有一致的 pass@k 增益,这得到了损失类型、锚点位置、层深度和损失权重消融的支持。