论文

TurnOPD:使在策略蒸馏轮次感知以高效训练长程智能体

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

摘要

在策略蒸馏(OPD)通过在学生自身轨迹上匹配更强教师训练学生策略——为语言智能体训练提供有前景框架。但其在长程智能体任务上的应用仍探索不足。我们识别普通智能体OPD的两个关键低效:(1) 全时程rollout常把墙钟资源浪费在提供弱且噪声KL监督的尾部轮上;(2) 轨迹级KL目标把大部分损失集中在浅层token上——初始行为对齐后、更深的决策轮欠训练。为此我们提出TurnOPD:面向长程智能体高效在策略蒸馏的轮级预算策略。TurnOPD含两个预算控制器:自适应rollout深度预算——用探针式轮统计确定rollout长度;渐进轮归一化损失预算——把KL权重从token级渐进转向轮平衡监督。ALFWorld、WebShop与多跳搜索上配任务专职教师模型的实验显示:TurnOPD在相同墙钟训练预算下取得更优验证准确率,并把准确率—时间前沿推进超越普通OPD。

TurnOPD:使在策略蒸馏轮次感知以高效训练长程智能体:论文配图
图 1:代理 OPD 的转向感知视角。标准 OPD 固定了 rollout 深度并在整个轨迹上平均 KL,通常会在低价值的尾部转弯上浪费资源,并过度关注浅层词元的损失。 TurnOPD 根据轮次统计数据对 rollout 深度和 KL 聚合进行预算,提供更平衡的监督信号。