论文
EasyOPD:大语言模型 的易于使用的 同策略 蒸馏 框架
EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models
摘要
传统的语言模型 蒸馏 通常依赖于固定的教师生成的数据,这可能无法涵盖不断发展的学生政策遇到的状态。 同策略 蒸馏 (OPD) 相反收集教师或评估者对学生生成的执行轨迹的监督。然而,现有的 OPD 方法在监督形式、分词器兼容性、教师访问和监督粒度方面存在很大差异,导致难以重现和扩展的碎片化实现。我们提出 \textsc{EasyOPD},一个基于 verl 构建的 同策略 蒸馏 框架,verl 是 大语言模型 的分布式强化学习框架。 \textsc{EasyOPD} 将用户端配置、特定于方法的监督逻辑和基于 verl 的执行分开。其方法模块通过扩展边界连接到共享后端,以进行损失构建、轨迹采样元数据、奖励处理、标记器对齐和教师端计算。我们实例化了三种 OPD 设置的代表性方法——交叉分词器 OPD、同策略 self-蒸馏 和逐步 OPD。关于推理、代码生成、科学知识和工具使用基准的实验表明,这些实现可以通过相同的基于 verl 的后端执行,同时保留其特定于方法的目标和依赖于任务的性能配置文件。我们发布了 \textsc{EasyOPD} ,其中包含可运行的 YAML 配置、文档以及可安装的演示包和视频。