论文

以交叉反馈和连贯筛选进行协作推理蒸馏

Collaborative Reasoning Distillation via Cross-Feedback and Coherent Curation

模型优化模型训练模型推理奖励建模与过程监督推理策略与问题分解蒸馏

摘要

推理能力对于推进大型语言模型至关重要,但当前的方法要么需要大量的计算预算,要么难以有效地将推理提炼为较小的模型。标准蒸馏方法依赖于基于结果的奖励,无法区分合理的推理和幸运的猜测。我们提出了协作推理蒸馏(CRD),这是一个通过三项创新增强紧凑模型中推理的框架:(1)交互式交叉反馈,教师迭代地批评彼此的推理,(2)细粒度的逐步质量评估,捕获独立于最终答案的逻辑有效性,以及(3)综合互补优势的连贯性感知步骤拼接。学生在预算限制下通过推理质量优化 (RQO) 进行培训。我们的模型 CRD-4B 在 MATH-500 上达到了 97.3%,在 AIME'25 上达到了 70.3%,仅使用 50K 训练示例就超越了基线,比同类模型的数据集小了 12 倍。

以交叉反馈和连贯筛选进行协作推理蒸馏:论文原图
图 1:CRD 框架概述。多位教师通过交叉反馈反复批评和完善彼此的推理。然后,LLM裁判会分配逐步的质量分数,思维路径算法会在教师之间缝合高质量的步骤,同时修剪有缺陷的步骤。精心策划的数据集用于通过 RQO 和最佳预算课程对学生进行培训。