论文

隐式分层 GRPO:将工具调用与工具集成数学推理的执行解耦

Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

模型训练强化学习Agentic RL

摘要

大语言模型 (LLM) 越来越多地利用工具调用来增强其推理能力。然而,现有方法通常将工具调用与立即执行紧密结合。这种即时的工具交互可能会破坏 LLM 的推理连贯性并限制其表达能力,最终降低推理性能。为此,我们首次提出并形式化了推理过程中工具调用与执行解耦的问题,并引入具有显式控制的延迟执行来增强工具集成推理(TIR)。此外,我们提出了一个分层控制框架,并从理论上推导了一个代理损失,使隐式分层策略能够学习与显式分层策略等效的行为,从而产生了所提出的 IH-GRPO 算法。 IH-GRPO 上的大量实验在 Qwen3-1.7B、Qwen3-4B 和 Qwen3-8B 上的六个域外数学推理基准上比最强基线方法实现了 1.87\%、2.16\% 和 2.53\% 的绝对改进,同时在其他领域也产生了一致的性能增益。我们的代码可在 https://github.com/Lumina04/IH-GRPO-01 获取。