论文

由轨迹引导:为工具集成推理修复并奖励工具使用轨迹

Guided by Trajectories: Repairing and Rewarding Tool-Use Trajectories for Tool-Integrated Reasoning

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

工具集成推理(TIR)使大语言模型(LLM)能够通过与外部工具交互解决复杂任务,然而现有方法依赖由评分函数挑选的高质量合成轨迹以及稀疏的基于结果的奖励,为TIR学习提供的监督有限且有偏。为应对这些挑战,本文提出AutoTraj,一个通过修复与奖励工具使用轨迹来自动学习TIR的两阶段框架。具体而言,在监督微调(SFT)阶段,AutoTraj为每个查询生成多个候选工具使用轨迹并沿多个维度评估。高质量轨迹直接保留,低质量轨迹则用LLM修复(即LLM-as-Repairer)。所得修复与高质量轨迹构成合成SFT数据集,而每条修复轨迹与其原始低质量配对构成轨迹偏好建模数据集。在强化学习(RL)阶段,基于偏好数据集,我们训练轨迹级奖励模型以评估推理路径质量,并将其与结果奖励、格式奖励结合,从而显式引导优化走向可靠的TIR行为。在真实世界基准上的实验证明了AutoTraj在TIR中的有效性。

由轨迹引导:为工具集成推理修复并奖励工具使用轨迹
图1:AutoTraj 架构。(a) SFT 阶段:AutoTraj 首先合成、评估并修复工具使用轨迹,以构建高质量 SFT 数据集与正-负轨迹对。(b) RL 阶段:随后在这些对上训练轨迹奖励模型,并在 GRPO 下与格式奖励和结果奖励集成,提供轨迹级监督。