论文

GraphOPD:以轨迹关系图增强LLM Agent在策略蒸馏

GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents

模型优化模型训练智能体系统强化学习Agent 环境交互蒸馏

摘要

当强化学习奖励稀疏并且每个轨迹仅到达一次时,策略蒸馏通过从教师策略提供密集的、步骤级的指导来对大语言模型Agent进行后训练。现有的实例化根据每一步师生分歧的大小来分配这种指导,基于单轮直觉,巨大的分歧标志着一个值得纠正的错误。一旦决策连锁了很多回合,这条规则就会失败,因为早期的漂移会进入每个后来的背景,这两种策略都会受到影响,让老师与漂移的轨迹保持一致,而不是标记其原因,而可互换的步骤会出现巨大但与结果无关的分歧。我们在 Agentic 基准测试中证明了这一点,其中提取最高分歧的步骤并没有比随机选择带来一致的好处。为此,我们引入了 GraphOPD,这是第一种将基于图的结构增强引入Agent能力的策略蒸馏的方法。它从环境自身的状态变化记录中读取哪些步骤启用了哪些步骤,不受破坏师生差距的漂移的影响,将它们组织成依赖图,通过随机游走平稳分布对每个步骤进行评分,并将结构信用与发散信号融合到轨迹相关的掩模中,集中监督每个Rollout的最高能力步骤。在 ALFWorld、WebShop 和 SearchQA 上的三个模型规模和 11 个基线中,GraphOPD 自始至终都表现出竞争性的性能,比最强的基线提高了高达 +5.8 个百分点。执行的重放审计进一步表明,这种结构性信用评分跟踪的真正因果影响远远高于偶然性,两个融合信号都是独立必要的,并且相同的信号传输到域外工具集成推理。

GraphOPD:以轨迹关系图增强LLM Agent在策略蒸馏:论文原图
图 2:GraphOPD 概述。从一次推出开始,并行计算两个每步信号,一个来自足迹构建的依赖图及其随机游走平稳分布的结构信用信号,以及来自轨迹内标准化的师生差距的发散信号。将两者融合为蒸馏能力A⁡(t)A(t),转换为轨迹相关掩模m⁡(t)m(t),并将所得的掩模蒸馏损失添加到未加权的GRPO目标中;每个阶段仅读取部署本身,不需要额外的模型调用。