论文

使用工具教授思维模型进行推理:工具集成推理的全流程配方

Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning

模型训练强化学习

摘要

工具集成推理(TIR)提供了一种直接的方法来扩展思维模型,超越纯文本推理的限制。矛盾的是,我们观察到即使强大的思维模型几乎没有进行实际的工具调用,工具支持的评估也会降低推理性能。在本文中,我们研究了如何将自然的工具使用行为注入到强大的思维模型中,而不牺牲其无工具推理能力,并提出了一个全面的 TIR 配方。我们强调,(i) TIR 监督的 微调 (SFT) 的有效性取决于教师轨迹的可学习性,这应该优先考虑本质上适合工具增强解决方案的问题; (ii) 控制工具使用轨迹的比例可以减轻纯文本推理能力的灾难性遗忘; (iii) 优化 pass@k 和响应长度而不是训练损失可以最大化 TIR SFT 增益,同时保留强化学习 (RL) 探索的空间; (iv) 具有可验证奖励的稳定强化学习 (RLVR) 阶段,建立在适当的 SFT 初始化和针对模式崩溃的显式保护措施之上,提供了一种简单但非常有效的解决方案。当应用于 4B 和 30B 规模的 Qwen3 思维模型时,我们的配方生成的模型在开源模型的各种基准测试中实现了最先进的性能,例如在 AIME 2025 上,4B 和 30B 分别达到 96.7% 和 99.2%。