论文
从结果到策略:数学推理的学习策略效用
From Outcomes to Strategies: Learning Strategy Utility for Mathematical Reasoning
摘要
具有可验证奖励的强化学习极大地提高了数学推理能力。然而,当与后续执行分开考虑时,仅终端正确性对高级策略(例如定理选择和子目标分解)质量的洞察力有限。本文研究策略效用,其定义为策略在给定执行器下支持正确下游解决方案的可能性。我们介绍 SURE,一个用于学习和利用相关策略效用的框架。在这个框架中,高层策略与其详细推理是分离的。基于根据策略条件rollout和教师生成的对比构建的成对偏好,学习策略奖励模型来估计相对策略效用。在强化学习期间,冻结奖励模型仅读取提取的策略,其得分与序列级 GRPO 目标中的正确性和格式奖励相结合。与结果和格式 GRPO 基线相比,实验表明,SURE 在三个策略骨干中将平均 pass@1 提高了 1.87%、2.64% 和 2.93%。我们的方法还比更强的奖励基线具有竞争力或更好的准确性,同时需要显着降低的 GRPO 阶段计算。