论文

综合和奖励——在现实环境中使用多步骤工具的强化学习

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

模型训练强化学习

摘要

训练 LLM 来编排多步骤工具调用受到三个耦合障碍的阻碍:现实的有状态执行环境的构建成本高昂,综合训练查询通常与服务器的实际状态分离(因此生成的工具调用无法执行),基于召回的 RL 奖励会激励详细的工具调用模式。我们提出了 PROVE(已验证环境的程序化奖励),这是一个具有三个贡献的框架:(1)一个由 20 个有状态 MCP(模型上下文协议)服务器组成的库,公开了 343 个工具,支持通过会话范围的状态隔离进行实时执行 RL 训练; (2) 状态机数据合成管道,生成基于实时采样服务器状态的多轮工具调用轨迹,从而生成查询引用实际存在的实体; (3) 具有自适应效率惩罚的多组件程序化奖励,可以抵消基于回忆的奖励的冗长激励。我们在生成的约 13K 训练样本上使用 GRPO 训练了四个模型(Qwen3-4B、Qwen3-8B、Qwen2.5-7B、Granite-4.1-8B)。在 BFCL Multi-Turn、tau2-bench 和 T-Eval 上,PROVE 分别实现了高达 +10.2、+6.8 和 +6.5 点的改进,表明该框架在跨两个模型系列的多步骤工具编排方面产生了一致的收益。