论文

来自现成教师的图条件策略Agent蒸馏

Graph-Conditioned On-Policy Agent Distillation from Off-the-Shelf Teachers

摘要

on-policy蒸馏(OPD)利用教师对学生生成的轨迹的反馈来训练紧凑的语言Agent。在多轮任务中,复合错误可能会使学生超出教师的有效监督。我们引入了图条件论策略Agent蒸馏 (GC-OPD),它通过执行证据丰富了现成的教师评分上下文。图表按共享状态对重复的教师处决进行索引,同时保留完整的成功和失败历史。在每个学生事件之后,GC-OPD 检索当前状态参考或历史替代方案,并将它们与学生的后见之明相结合,以对原始思想行动标记进行评分。使用相同的原始教师,GC-OPD 比普通 OPD 在 ScienceWorld(4B 学生)上的平均成功率从 24.70% 提高到 48.78%,在 ALFWorld Unseen 上从 53.36% 提高到 85.26%,在 WebShop 上从 29.10% 提高到 37.65%。在匹配的学生规模下,它还比在 ScienceWorld 和 ALFWorld 上使用经过 GRPO 培训的教师评估的每个 OPD 基线取得了更高的平均成功率;其中ScienceWorld 4B基线最强达到46.66%。 GC-OPD 不需要针对特定​​任务的教师优化。