论文
通过约束数据合成和分级奖励来训练 LLM 进行多步骤工具编排
Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards
摘要
对于 LLM 来说,多步工具编排仍然具有挑战性,因为最先进的模型经常因参数错误而在全序列执行中失败。这些工作流程的训练面临两个障碍:缺乏支持复杂的现实世界 API 依赖关系的环境,以及稀疏的二进制奖励无法提供部分正确性的信号。我们提出了一个强化学习框架来解决这两个挑战。首先,我们构建了一个由真实 API 响应的大规模缓存支持的确定性环境,从而能够以可控的复杂性对有效的多步骤跟踪进行约束合成。其次,我们引入了分级奖励,将正确性分解为原子有效性(粒度增加的调用级正确性)和编排一致性(具有依赖性的正确排序)。在 ComplexFuncBench 上,我们的方法大大提高了转弯准确性,并通过消融确认了两个奖励组件都是必不可少的。 BFCL v4 的交叉基准评估表明,学到的编排技能转移到完全不同的 API 生态系统(例如代理网络搜索和内存管理),在保持稳定的单步性能的同时产生一致的收益。代码可在 https://github.com/horizon-rl/ToolOrchestrationReward 获取