论文
知识蒸馏 从大型推理模型到紧凑学生模型:约翰·O·布莱恩数学竞赛案例研究
Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition
摘要
本文研究了 知识蒸馏 从大型推理模型(DeepSeek-R1)到紧凑学生模型(Qwen2.5-7B)的情况。利用北肯塔基大学约翰·奥布莱恩数学竞赛(2011-2025)的历史问题,我们通过双代理框架构建了思想链(CoT)训练语料库。该数据集用于使用 MLX 框架在 Apple Silicon 硬件上通过低秩适应 (LoRA) 微调学生模型。基础Qwen2.5-7B模型在竞争问题上达到了64.67%的准确率,而DeepSeek-R1老师达到了91.40%。最初的 1,000 次迭代训练运行显示出严重的过度拟合,验证损失在迭代 200 时达到最小值,然后稳步上升。基于这一发现,我们使用不同的随机种子进行了 5 次独立训练,每次迭代限制为 200 次,以评估结果稳定性。在这五次运行中,经过微调的学生模型在竞赛数据集上的平均准确度为 69.43%(标准差 0.17%),比基础模型提高了 4.76 个百分点,并且在 MATH-500 基准上泛化到 73.1%(标准差 0.18%)。我们进一步研究了响应长度如何影响六个推理级别(R1-R6)的答案质量:准确性从 R1(平均 220 个单词)的 69.43% 持续下降到 R6(平均 31.2 个单词)的 41.9%,其中两人速度部分对标记减少最敏感。这些结果表明,CoT 蒸馏 改进了紧凑的学生模型,并且响应长度是数学推理质量的关键因素。