论文

DeepTool:通过过程监督强化学习扩展工具集成推理中的交错式深思

DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

工具集成推理(TIR)通过利用外部环境来扩展LLM的能力。然而,现有方法在序贯工具调用过程中缺乏策略规划与自我纠正所需的深思。尽管强化学习能缓解这一问题,但传统的工具集成推理方法受制于稀疏的基于结果的奖励,无法监督中间推理步骤与工具调用。为此,我们提出DeepTool,一个在每轮思考、动作与观察交错过程中扩展深思式思考的新框架。在DeepTool中,我们首先引入一个合成管线,将扩展思考演化成交错式轨迹,并融入对抗扰动以保证鲁棒性与自我纠正。其次,我们设计了基于GRPO的过程监督强化学习,利用以动作为中心的过程奖励来强化中间交错思考,并在每一轮强制精确的工具调用。大量实验表明,DeepTool取得卓越性能,使Qwen2.5-7B在六个基准上显著提升(例如AIME24从3.2%提升到40.4%,HMMT25从0.0%提升到28.6%)。此外,token成本效益分析证实了交错思考的价值,表明DeepTool在性能与token效率之间达到最优平衡。

DeepTool:通过过程监督强化学习扩展工具集成推理中的交错式深思:论文配图
图 1:MOSAIC 合成流程。采用分层管理器-参与者架构,利用推理模型作为参与者策略 () 来根据战略意图综合系统 2 级审议 ()。算子 Φ\Phi 随机注入扰动(概率为 ρ\rho)以创建扰动步骤,从而促进稳健的错误恢复。