论文
PACT:多轮工具使用代理的特权跟踪协同训练
PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents
摘要
多轮工具使用代理必须推理、调用工具并适应多个交互轮次的观察。 后训练 此类代理具有挑战性,因为强化学习尽管匹配仅提示推理设置,但通常会受到奖励稀疏和贡献分配较弱的影响,而专家轨迹上的监督 微调 提供密集的过程监督,但可能会将模型过度约束到固定轨迹。为了解决这个问题,我们提出了 PACT,一种用于多轮工具使用代理的特权 trace 协同训练框架。关键思想是仅使用专家轨迹作为训练时优化信号,而不是轨迹生成时提示。 PACT 保持 rollout 生成仅提示,然后使用专家轨迹通过两个互补信号来指导优化:跟踪条件 RL 代理,在专家轨迹上下文下评估仅提示的 rollout,以及组件感知的 SFT 损失,用于监督推理前缀和具有退火强度的工具调用。为了减少对仅训练跟踪上下文的过度依赖,PACT 进一步引入了仅提示锚定。我们还提供了一个潜在跟踪视图,它将两个基于跟踪的目标连接起来,并解释了专家轨迹如何在不使用部署生成期间的情况下指导优化。 FTRL、BFCL 和 ToolHop 上的实验表明,PACT 持续改进基于 SFT 和 RL 的强大基线,凸显了特权跟踪协同训练对于多轮工具使用学习的价值。