论文

推理质量很早就出现:推理模型的数据管理

Reasoning Quality Emerges Early: Data Curation for Reasoning Models

模型训练合成数据

摘要

在小型、高质量的长推理轨迹集上监督 微调 (SFT) 是在 大语言模型 (LLM) 中激发强大推理能力的有效方法。然而,现有的管理高质量 SFT 数据的方法严重依赖强大的推理模型来根据多样性和难度来过滤示例,这使得管理过程成本高昂,同时往往会产生次优的数据质量。在这项工作中,我们表明仅使用初始推理标记就可以识别多样化且具有挑战性的推理示例。具体来说,我们证明,根据在预训练模型的随机扰动检查点评估的前 100 个推理标记的丢失,可以可靠地检测困难问题。我们进一步表明,在沿着 微调 轨迹外推的少量扰动检查点上,在前 1k 个推理标记上表现出类似损失模式的示例可证明会产生类似的梯度。我们通过在 M23K 医学推理和 OpenThoughts-Math 数据集上对 微调 Qwen2.5-7B 和 Llama3.1-8B 模型进行大量实验来验证我们的方法。我们的方法比现有基准的性能提高了 1.7%,同时词元效率提高了 91%。