论文

Caddie:依据任务结果训练LLM Agent顾问

Training Advisors for LLM Agents from Task Outcomes

模型训练模型推理智能体系统强化学习推理验证与自校正Agent 架构与控制循环

摘要

大语言模型Agent通过将推理和工具调用与环境观察交织在一起来处理多步骤任务。之前的工作表明,自然语言反馈可以帮助这些Agent在任务执行期间修改他们的决策。我们引入了 Caddie,这是一种训练批评者在Agent完成任务时提供自然语言分析和建议的方法。与依赖步骤级标签或参考批评的方法不同,Caddy 在收到批评者的反馈后通过Agent是否最终成功来了解。我们通过强化学习优化批评者,同时保持基本模型冻结。我们的 Qwen3-4B 批评家经过使用单一基本模型的多跳问答训练,提高了不同规模和架构的四个基本模型的成功率,其中包括批评家培训期间未使用的三个模型。在MuSiQue基准上,训练有素的批评家将Qwen3-4B的成功率提高了25个百分点以上,超过了没有批评家的Kimi K3的表现。同样的批评家也对域外交互产生了影响 基准测试,包括 $τ^3$ 和 DeepDive,无需额外培训。我们的结果表明,智能体可以决定何时在推理时向批评家寻求帮助,并且基于结果的批评家训练可以产生跨基本模型和任务领域转移的指导。

Caddie:依据任务结果训练LLM Agent顾问:论文原图
图 1:培训和使用球童。 (a) 训练:冻结的智能体 πb\pi_{b} 推出任务并随机选择步骤 kk;在前缀 sks_{k} 处,批评家 πcθ\pi_{c}^{\theta} 对 GG 批评进行采样;然后,每个批评都会附加到前缀上,冻结代理会推出 NN 延续,直到剧集结束。最终奖励在组内标准化,并且仅使用 DAPO 更新批评者。 (b) 推理:智能体决定何时通过 call_critic 工具咨询批评者,并接收批评作为工具输出。