论文
面向智能体强化学习的可控且可验证的工具使用数据合成
Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning
摘要
现有的合成工具使用语料主要为离线监督微调而设计,而强化学习(Reinforcement Learning, RL)需要可执行的、支持奖励可检验的在线rollout的环境。我们提出COVERT,一个两阶段流水线:首先通过带多级验证的自进化合成生成可靠的基础工具使用轨迹,然后施加保持标准答案(oracle)的增广,系统性地提升环境复杂度。这些增广引入干扰工具、间接或含糊的用户提问,以及带噪声、多格式或错误的工具输出,同时严格保留oracle工具调用与最终答案作为标准真值。这一设计使得标准情形可通过参照匹配自动计算奖励,而错误检测等特殊行为则通过轻量的裁判辅助验证,从而支持对工具调用策略的RL优化。在Qwen2.5-Instruct-14B上,COVERT-RL将BFCL v3的总体准确率从56.5提升到59.9,将ACEBench从53.0提升到59.3,且在通用能力基准上仅有极小回退;与SFT叠加后进一步达到62.1与61.8,证实了增益的可叠加性。这些结果表明,保持oracle的合成环境提供了一个与SFT互补的实用RL精炼阶段,可用于提升歧义与不可靠工具反馈下的工具使用鲁棒性。
