论文

SENTINEL:用于训练使用语言模型代理的工具的故障驱动强化学习

SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

模型训练强化学习

摘要

语言模型代理通过使用多轮工具来解决现实任务越来越有效。然而,训练可靠的使用工具的代理在实践中仍然具有挑战性。虽然强化学习提供了 同策略 范式来改进智能体自身环境交互,但其有效性在很大程度上取决于训练任务分配。当任务在训练之前固定时,任务分配可能会与策略不断发展的功能越来越不匹配,从而导致许多采样轨迹花费在无信息的任务上。我们提出了 SENTINEL,这是一种失败驱动的强化学习框架,可将求解器的执行轨迹失败转化为有针对性的训练任务。 SENTINEL 遵循控制器 - 提议者 - 求解器循环:控制器分析失败的轨迹并总结重复出现的错误模式,提议器生成强调这些弱点的可执行任务,求解器接受目标任务的训练。在使用 Qwen3-4B-Thinking-2507 的 Tau2-Bench Retail 上,SENTINEL 将 Pass\^{}1 从 66.4 提高到 74.9,并且在 Pass\^{}k 指标的一般合成任务上优于 RL。这些结果表明,模型失败为改进使用工具的语言模型代理提供了有效且可扩展的目标训练信号源。