论文

学习使用工具:面向工具集成数学推理的强化学习

Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning

模型训练强化学习RLVRAgentic RL

摘要

当前的大语言模型(LLM)越来越多地受益于外部工具集成,特别是对于需要可靠计算和验证的任务。受此启发,我们研究了计算器工具,要求改进倒计时任务的数学推理。我们首先分析推理失败,发现计算错误占了错误响应的很大一部分。然后,我们构建有监督的微调数据集,以教授模型有用的工具使用模式以及如何解释返回的输出。在此工具格式策略的基础上,我们应用了多种策略强化学习方法,包括 RLOO、RLOO++、GRPO 和 DAPO,并使用可自动验证的最终答案奖励。为了实现更可靠的评估,我们构建了一个新的 1,024 个问题保留倒计时基准,与训练数据没有完全重叠。我们的结果表明,计算器工具集成持续改善了 SFT 和 RL 基线,在 pass@k 中产生了大约 10 个百分点的收益。在 RL 方法中,Tool-DAPO 实现了最强的性能,将 pass@1 从 Tool-SFT 的 35.8% 提高到了 66.0%。进一步的分析表明,即使只提供最终答案奖励,强化学习也鼓励更有效地使用工具。这些发现表明,工具集成减少了算术和验证错误,而强化学习则增加了正确推理轨迹的概率。

学习使用工具:面向工具集成数学推理的强化学习:论文配图
图1 数学推理工具集成大语言模型RL示意图。