论文
在没有推理轨迹的情况下训练专家模型以进行领域专家蒸馏
Training Specialist Models without Reasoning Trajectories for Domain Expert Distillation
摘要
专家蒸馏通过教师生成的推理轨迹有效地将领域专业知识转移到学生模型。然而,当这些专家仅接受问答对训练而没有明确的推理监督时,什么控制着他们生成的轨迹?在这项工作中,我们表明专业优化隐式地从这个潜在轨迹空间中进行选择。为了隔离和观察这种潜在分布,我们利用学生蒸馏不是下游目标,而是作为不可知论的探针——因为学生没有从专家那里继承参数化或优化约束,只继承采样轨迹本身。通过这一探索,我们的实证分析揭示了一种紧密的支配关系:在 27 个专家与学生配对中,他们的专业化与泛化特征异常强烈地相关。至关重要的是,明确控制专家的分布漂移可以系统地改变教师和其精炼的学生在领域精度和一般能力保留之间的可控权衡。在化学、物理和多语言环境中,精炼的学生系统地反映了这些专家诱导的概况,甚至在不同的模型家庭中也是如此。我们的研究结果建立了专业训练的新观点:当缺乏黄金推理时,调整选择直接控制传递给下游模型的潜在监督。