论文
Caddie:依据任务结果训练LLM Agent顾问
Training Advisors for LLM Agents from Task Outcomes
摘要
大语言模型Agent通过将推理和工具调用与环境观察交织在一起来处理多步骤任务。之前的工作表明,自然语言反馈可以帮助这些Agent在任务执行期间修改他们的决策。我们引入了 Caddie,这是一种训练批评者在Agent完成任务时提供自然语言分析和建议的方法。与依赖步骤级标签或参考批评的方法不同,Caddy 在收到批评者的反馈后通过Agent是否最终成功来了解。我们通过强化学习优化批评者,同时保持基本模型冻结。我们的 Qwen3-4B 批评家经过使用单一基本模型的多跳问答训练,提高了不同规模和架构的四个基本模型的成功率,其中包括批评家培训期间未使用的三个模型。在MuSiQue基准上,训练有素的批评家将Qwen3-4B的成功率提高了25个百分点以上,超过了没有批评家的Kimi K3的表现。同样的批评家也对域外交互产生了影响 基准测试,包括 $τ^3$ 和 DeepDive,无需额外培训。我们的结果表明,智能体可以决定何时在推理时向批评家寻求帮助,并且基于结果的批评家训练可以产生跨基本模型和任务领域转移的指导。
