论文

CAST:用于训练可靠的长视野工具调用代理的批判意识监督

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

模型训练奖励建模与过程监督

摘要

大语言模型 (LLM) 代理越来越多地部署在长范围、交互式和有状态的环境中。在这些设置中,单个错误操作(例如退款错误的购买)可能会导致不可逆的任务失败,并且必须在执行之前进行拦截。此类故障可能不会出现在每次运行中,但可能会在重复试验中出现,因此步骤和试验的可靠性至关重要。然而,确保代理可靠性具有挑战性:即使是前沿的 LLM 也很难解释为什么一个操作可能是错误的,特别是在由特定领域策略控制的漫长、交织的轨迹中。最近的许多工作依赖于基于提示的批评代理,而基于优化的方法缺乏系统的方法来为训练提供丰富的验证理由。我们通过 CAST 解决了这一差距,CAST 是一种批判意识训练框架,可将稀疏的任务结果转化为行动层面的监督,以进行批判学习和政策优化。 CAST 分析智能体轨迹,以综合解释部分可观察性下行动有效性的结构化原理。由此产生的批评模型用于构建批评感知训练数据以优化政策模型。 微调 Qwen3 系列模型基于动态工具调用基准,CAST 提高了跨域的可靠性,在零售任务上比 GPT-OSS-120B 提高了 10% 以上通过^4,并在域外设置中的远程医疗方面额外提高了 9%。这些结果表明,批判意识训练提高了 LLM 智能体在现实动态环境中的鲁棒性。