论文

Agentic-DPO:从模仿到专家轨迹上的智能体策略优化

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

模型训练偏好优化强化学习Agentic RL

摘要

大语言模型(LLM)智能体通常以监督微调(SFT)从专家轨迹训练——把多轮智能体行为当普通文本模仿。这一配方简单低成本,但只学会模仿专家动作序列,而非训练智能体在每个状态对抗貌似合理的错误选择正确动作。缓解此问题的既有方法包括偏好学习或强化学习,但通常需要高成本的环境rollout与奖励模型。我们提出Agentic-DPO:一个轻量的离线智能体策略优化方法,把专家轨迹转为状态条件化的偏好监督。在每个专家动作状态处,Agentic-DPO从当前状态采样一个一步动作、把貌似合理的错误动作当负例、以DPO式偏好目标与专家动作对比。为避免在偏好学习中混合策略与模式,我们引入策略保持增广(PPA):在多个模式下渲染同一潜在轨迹而保持专家策略不变。Agentic-DPO无需在线环境rollout、奖励模型或全轨迹学生探索。在StableToolBench、tau-bench零售与Mind2Web上的实验显示:Agentic-DPO在不同模型规模上一致超越模仿;特别是把9B模型的tau-bench准确率从21.7%(SFT)提到41.4%——同底座下匹敌在线GRPO,仅需步级rollout、梯度步内无环境交互。结果表明:把示范转为状态级动作偏好,专家轨迹即可支撑低成本的智能体策略优化。代码发布于GitHub。

Agentic-DPO:从模仿到专家轨迹上的智能体策略优化:论文配图
图 1:说明 SFT 和 Agentic-DPO 在代理培训方面的差异。 SFT 将专家轨迹视为词元级别的监督,并训练模型来模仿演示的词元。相比之下,Agentic-DPO 将每个专家操作视为以状态为条件的策略决策。它将专家操作与从当前学生策略中采样的一步操作进行对比,并训练模型更喜欢专家操作而不是可能的学生错误。