论文

通过大师蒸馏实现语言模型的有据国际象棋推理

Grounded Chess Reasoning in Language Models via Master Distillation

模型优化模型训练强化学习蒸馏RLVR

摘要

在训练数据稀缺而定制系统表现出色的专业领域,语言模型往往缺乏有据推理能力。我们提出一个通用框架,将专家系统的推理蒸馏为自然语言思维链(chain-of-thought)解释,使紧凑模型能够习得领域专长并生成忠实、有据的解释。我们不仅蒸馏最终输出,而是捕捉完整推理过程,将不透明的专家计算转化为透明的、分步的解释。我们在国际象棋这一语言模型持续表现不佳的典型推理领域验证了该方法。我们的40亿参数模型C1从接近零的基线提升至48.1%的准确率,超越所有开源模型和大多数前沿闭源系统。值得注意的是,C1超越了其蒸馏教师,并且生成解答所用的token数比基线少两个数量级。与以往仅预测最佳着法的神经国际象棋方法不同,C1生成可解释的解答,展现其战略推理。我们的流水线结合了监督微调与强化学习,并采用主题均衡的数据采样以实现全面的战术覆盖。大师蒸馏(Master Distillation)展示了如何将专家级知识注入面向优化不足领域的紧凑模型,为在LLM基础能力不足时解锁RLVR提供了一条路径。

通过大师蒸馏实现语言模型的有据国际象棋推理:论文配图
图1:国际象棋解题上,C1以远小于前沿模型的体量取得可与之竞争的成绩,印证大师蒸馏方法的有效性。