论文

推理如何从 后训练 数据演变而来:使用国际象棋的实证研究

How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess

模型评测模型行为与机制分析

摘要

我们通过分析一组受理论启发的数据集如何影响国际象棋中的语言模型性能,研究推理如何在语言模型中演变——从监督 微调 (SFT) 到强化学习 (RL)。我们发现 微调 是一个直接预测最佳移动的模型,可以带来有效的强化学习和最强的下游性能——然而,强化学习阶段会引发 \textit{不忠实} 推理(与所选移动不一致的推理)。或者,多移动轨迹训练可以产生可比的下游性能,并具有忠实的推理和更稳定的强化学习。我们分析了多种定性和定量指标,并重点介绍了这些指标是如何从 SFT 发展到 RL 的;我们发现几个 SFT 检查点指标——涵盖评估表现、幻觉率和推理质量——可以预测强化学习后模型的表现。最后,我们通过在自定义数据集中测量 \textit{国际象棋信息密度} 的实验来验证我们的结果。我们发布了模型以及训练数据、评估和代码,使我们能够通过 7B 参数模型超越国际象棋领域领先的开源推理模型。代码、模型和数据可在 https://github.com/lucasdino/lang-chess 获取。