论文
TIER:多步工具组合的轨迹不变执行奖励
TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition
摘要
工具的使用使 大语言模型 能够通过 API 调用序列解决复杂的任务,但现有的强化学习方法无法扩展到多步骤组合设置。基于结果的奖励仅提供稀疏的反馈,而轨迹监督的奖励依赖于带注释的参考解决方案,从而惩罚有效的替代方案并限制可扩展性。我们提出了 TIER:轨迹不变执行奖励,这是一种奖励框架,直接从函数模式和运行时执行而不是从参考轨迹中获得监督。奖励分解为格式有效性、模式遵守、执行成功和答案正确性,提供来自工具使用各个步骤的细粒度验证的密集、可解释的序列级反馈。这种设计允许任何有效的执行路径获得信用,自然支持多种解决方案策略并适应不断发展的工具界面。在 DepthBench(按深度(1 至 6 个步骤)分层的成分基准)上,TIER 在各步骤中实现了 >90% 的准确度,其中轨迹监督奖励在第 4 步之后崩溃。我们进一步展示了 BFCL v3 和 NestFUL 等基准测试的持续收益。消融研究证实所有奖励成分都是必要的,强调了多层次监督对于组合推理的重要性。