论文
CoDistill-GRPO:用于高效组相关策略优化的 Co-蒸馏 配方
CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization
摘要
组相对策略优化(GRPO)已成为一种用于提高语言模型推理能力的强大算法,但由于困难任务的奖励稀疏,通常无法改进小型模型。现有的工作通过利用更大的模型来缓解这个问题,要么提供采样轨迹的提示,要么通过 知识蒸馏 (KD) 提供密集的奖励信号。然而,这假设存在这样一个预言机,并且训练一个预言机可以显着增加总训练时间。在这项工作中,我们提出了 CoDistill-GRPO,这是一种 co-蒸馏 算法,它通过最大化精心设计的 GRPO 目标来同时训练大型和小型模型。这两个模型相互学习:小模型使用 同策略 KD 奖励从大模型的分布中学习,而大模型使用小模型生成的 rollout 进行更新,并重新加权,减少了 rollout 生成的计算开销。我们表明,在 Qwen 和 Llama 模型的数学基准上,CoDistill-GRPO 比标准 GRPO 显着提高了小模型性能。具体来说,在 Minerva 数据集上,使用 Qwen2.5-Math-1.5B,我们观察到准确率比基本模型提高了 11.6 个百分点以上,比 GRPO 提高了 6.0 个百分点。有趣的是,尽管是在小模型上进行训练,但使用 CoDistill-GRPO 训练的较大模型 (Qwen2.5-Math-7B) 几乎与标准 GRPO 性能相匹配。这凸显了 CoDistill-GRPO 作为大型模型中 GRPO 的经济高效替代方案,可实现约 18% 的加速,这可能具有独立意义。