论文
梯度知道结果不知道什么:通过梯度对齐奖励解锁 LLM 推理的强化学习
Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards
摘要
可验证奖励的强化学习(RLVR)驱动 大语言模型 中的思想链推理,但其二元结果奖励无法区分正确的轨迹。现有的密集奖励替代方案,从表面启发式到过程奖励模型,要么忽略训练语料库中已有的专家解决方案,要么需要昂贵的离线注释。我们提出了梯度对齐奖励(GAR),它在策略自己的梯度空间中运行:通过输出投影层的截断反向传播为每条采样轨迹提取一个紧凑的梯度向量,并且与专家锚梯度的余弦相似度产生密集的、推理感知的奖励,而挂钟开销不到 9%。我们证明这个余弦可以乘法分解为预测误差和激活模式因子,从而提供对准信号测量内容的具体表征。在 Qwen3-4B 和 Qwen3-8B 上,GAR 在竞赛级数学基准上持续优于 GRPO 和其他基线,并在没有特定领域数据的情况下转移到 GPQA Diamond 和 MMLU-Pro。代码和数据可在 https://github.com/LQgdwind/GAR 获取。