论文

面向智能体强化学习的可控且可验证的工具使用数据合成

Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning

模型训练强化学习合成数据Agentic RL

摘要

现有的合成工具使用语料主要为离线监督微调而设计,而强化学习(Reinforcement Learning, RL)需要可执行的、支持奖励可检验的在线rollout的环境。我们提出COVERT,一个两阶段流水线:首先通过带多级验证的自进化合成生成可靠的基础工具使用轨迹,然后施加保持标准答案(oracle)的增广,系统性地提升环境复杂度。这些增广引入干扰工具、间接或含糊的用户提问,以及带噪声、多格式或错误的工具输出,同时严格保留oracle工具调用与最终答案作为标准真值。这一设计使得标准情形可通过参照匹配自动计算奖励,而错误检测等特殊行为则通过轻量的裁判辅助验证,从而支持对工具调用策略的RL优化。在Qwen2.5-Instruct-14B上,COVERT-RL将BFCL v3的总体准确率从56.5提升到59.9,将ACEBench从53.0提升到59.3,且在通用能力基准上仅有极小回退;与SFT叠加后进一步达到62.1与61.8,证实了增益的可叠加性。这些结果表明,保持oracle的合成环境提供了一个与SFT互补的实用RL精炼阶段,可用于提升歧义与不可靠工具反馈下的工具使用鲁棒性。

面向智能体强化学习的可控且可验证的工具使用数据合成:论文配图
图 1:拟议的 COVERT 管道概述。第一阶段通过自我演化和验证,通过简单的查询和单一工具生成可靠的基础工具使用轨迹。第 2 阶段应用预言机保留增强来生成具有噪声和多格式输出的复杂多工具场景,同时保留预言机工具行为以在 RL 训练期间进行奖励计算。