论文
CoRD:经协作式逐步多教师解码蒸馏长CoT推理
Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding
摘要
蒸馏大型推理模型对让长CoT推理实用化至关重要,因为全规模推理在计算上难以负担。现有基于筛选的方法事后挑选完整推理轨迹,忽视异构教师间的协作,也缺乏动态探索,导致冗余采样并错失互补推理。我们提出CoRD,一个协作式多教师解码框架:以预测困惑度打分与束搜索引导,逐步合成推理。这使异构LRM能共同构建连贯的推理轨迹,同时高效保留多样、高潜力的假设。实验显示,CoRD产出更高质量的推理数据,以更少的结构化监督信号达到接近教师级的学生性能,且无明显效率开销。CoRD在域外与开放式 setting 上也泛化良好。数据集与模型见GitHub。
