论文
半事实信用增强政策优化
Semifactual Credit-Augmented Policy Optimization
摘要
具有可验证奖励的强化学习(RLVR)提高了大语言模型(LLM)的推理能力,但它们的预测仍然对与任务无关的提示特征敏感。我们通过半事实的即时干预来调查这种敏感性,以保留潜在的问题及其答案。我们的分析揭示了词元级别敏感性的显着变化,并表明在解码过程中抑制高漂移词元候选可以提高推理准确性,而无需更新模型权重。这些发现凸显了组相对策略优化(GRPO)的局限性,该优化为每个响应标记分配相同的结果衍生优势,并且可能会强化潜在的虚假依赖以及有用的推理。受这一观察的启发,我们引入了半事实信用增强策略优化(SCAPO),这是一种受因果启发的 GRPO 变体,它将半事实稳定性纳入词元级信用分配中。 SCAPO 测量半事实干预下固定响应的词元概率漂移,并使用归一化稳定性分数来减少早期训练期间相对不稳定词元的优势,同时不单独给予稳定性额外的信用。在 Qwen3-4B-Base 和 Qwen3-1.7B-Base 上,SCAPO 将 AIME 2024-2026 的准确度比 GRPO 分别提高了 5.63 个和 4.17 个百分点。在两种模型尺度上,SCAPO 在大多数评估的数学基准和所有评估的分布外基准上都取得了最佳结果。这些结果表明,半事实稳定性为通过 RLVR 中更细粒度的信用分配来改进推理和泛化提供了有效的训练信号。该代码可在 https://github.com/DtYXs/SCAPO. 获取