论文

智能体批判式训练

Agentic Critical Training

模型训练强化学习Agentic RL

摘要

将大语言模型(LLM)训练为自主智能体往往始于模仿学习,但它只教智能体做什么而不理解为什么:智能体从未将成功动作与次优替代动作进行对比,因而缺乏对动作质量的感知。近期方法试图通过引入由专家动作与替代动作对比推导的自我反思监督来解决这一问题。然而,其训练范式本质上仍是模仿学习:模型模仿的是预先构造的反思文本,而非学会自主推理。我们提出智能体批判式训练(ACT),一种训练智能体在备选动作中识别更优动作的强化学习范式。通过对模型判断是否正确给予奖励,ACT促使模型自主发展关于动作质量的推理,产生真正的自我反思而非模仿反思。在三个具有挑战性的智能体基准上,ACT与不同后训练方法结合时均能持续提升智能体性能。相比模仿学习它平均提升5.07分,相比强化学习平均提升4.62分。与通过知识蒸馏注入反思能力的方法相比,ACT也展现出明显优势,平均提升2.42分。此外,ACT在智能体基准上实现了较强的分布外泛化,并在不使用任何推理专项训练数据的情况下提升了通用推理基准上的性能,凸显了该方法的价值。这些结果表明,ACT是开发更具反思能力、更强大LLM智能体的一条有前景的路径。

智能体批判式训练:论文配图
Figure 1: Comparison of imitated vs. genuine self-reflection. (a)早期经验在环境中执行这两个动作,从结果状态生成反射,并训练模型通过监督微调(SFT)来模仿这个固定文本。 (b) ACT presents two candidate actions and trains the model via RL to select the better one. Since only the selection outcome is rewarded, the model must autonomously develop reasoning about action quality to maximize reward.