论文

SOD:用于小语言模型代理的逐步 同策略 蒸馏

SOD: Step-wise On-policy Distillation for Small Language Model Agents

摘要

由于长期工具交互的不稳定和模型容量有限,工具集成推理(TIR)很难扩展到小型语言模型。而强化学习方法(例如群体相对策略优化)仅提供稀疏的结果级别奖励。最近,同策略 蒸馏 (OPD) 通过提供教师对学生生成轨迹的密集 词元级 监督而受到欢迎。然而,我们的实验表明,将 OPD 应用于 TIR 会导致严重的失败模式:错误的工具调用往往会级联到后续的推理步骤,逐渐放大学生与教师的分歧,并使教师的 词元级 监督变得越来越不可靠。为了解决这个问题,我们提出了 SOD,一种用于小语言模型代理的逐步 同策略 蒸馏 框架,它根据步级发散在每一步自适应地重新加权 蒸馏 强度。因此,SOD 可以减弱高分歧区域中潜在的误导性教师信号,同时保留良好对齐状态中的密集指导。对具有挑战性的数学、科学和代码基准的实验表明,SOD 比第二好的基准提高了 20.86%。值得注意的是,我们的 0.6B 学生在 AIME 2025 上取得了 26.13% 的成绩,展示了代理推理到轻量级模型的有效迁移。我们的代码可在 https://github.com/YoungZ365/SOD 获取。