论文
SPSD:把棋类自博弈搜索蒸馏为推理数据
Self-Play Search Distillation for Large Language Model Reasoning
摘要
提高大型语言模型 (LLM) 的推理能力需要高质量的数据,以揭示困难的决策、竞争性的替代方案及其后果。数据稀缺是由合成数据的低质量和人工标记的成本造成的。我们引入了自对弈搜索蒸馏(SPSD),这是一个通过在棋盘游戏上训练的类 MuZero 网络的自对弈来生成超人类合成数据的框架。 SPSD 使用可执行环境将搜索转化为结构化推理问题。在每个状态下,专家都会确定首选决策、合理的替代方案、合理的对手答复以及价值估计。通过将自我对战搜索记录转化为超人的思维链,我们用基于环境的监督来培训大语言模型。尽管仅接受自对弈搜索记录的训练,但 SPSD 已转移到看不见的数学领域。在 Qwen3-4B-Base 上,它将六个数学基准的平均值从 24.1 提高到 36.6,同时将留出游戏胜率从 15% 提高到 45%。 SPSD 提供了一种高效注释的方法来创建高质量的合成数据,以提高 LLM 在推理任务中的性能。