论文
Agentic 策略蒸馏的随机教师干预
Stochastic Teacher Intervention for Agentic On-Policy Distillation
摘要
在策略蒸馏 (OPD) 通过对学生生成的部署进行密集的token级监督,有效地将功能从更强大的教师转移到学生语言模型,并在数学推理等复杂任务上显示出前景。然而,在多轮 agentic 任务中,学生的决定会影响后续观察,导致早期错误在轮次中累积。由此产生的轨迹可能会偏离教师的推出分布,从而使教师的token级监督不太可靠,甚至对 OPD 培训产生反作用。为了解决这个问题,我们引入了 STI-OPD,这是一种用于多轮 agentic OPD 的随机教师干预框架。在多轮交互过程中,STI-OPD利用师生政策差异引导的教师干预,用教师生成的行动代替学生提出的行动,以最大限度地获得可靠的监督。我们进一步开发随机干预策略,解决以前基于阈值或固定时间表方法的局限性, 使用 KL 散度估计政策差异并将其映射到干预概率。通过根据该概率采样是否进行干预,STI-OPD 自适应地平衡教师控制与学生探索。为了从所得的混合策略轨迹中学习,我们引入了重要性加权反向 KL 目标,该目标纠正教师生成的响应和学生策略之间的token采样不匹配,以保留原始的 OPD 目标。在工具集成推理和长期交互方面,STI-OPD 在每个评估基准和学生规模上都优于先前最强的 OPD 基线。消融进一步表明,差异引导的干预和重要性加权都有助于这些成果。