论文
CoTEvol:用于数学推理数据合成的自演化思维链
CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical Reasoning
摘要
大语言模型(LLM)在高质量、能清晰表达中间步骤的思维链(Chain-of-Thought, CoT)上训练时展现出强大的数学推理能力,但成本高昂的CoT数据整理阻碍了进一步进展。尽管从更强LLM蒸馏和基于测试时搜索的自合成等现有方案可缓解这一问题,但它们常常面临收益递减或高昂的计算开销。在这项工作中,我们提出CoTEvol,一个将CoT生成转化为基于种群的推理轨迹搜索的遗传演化框架。候选轨迹通过轨迹层面的反思性全局交叉和步骤层面由不确定性引导的局部变异进行迭代演化,实现整体重组与细粒度精炼。轻量级、任务感知的适应度函数被设计用来引导演化过程朝着准确且多样的推理方向进行。实证结果表明,CoTEvol将正确CoT的合成成功率提升超过30%,并增强了结构多样性,效率也显著改善。在这些演化CoT数据上训练的LLM在八个数学基准上平均提升6.6%,超越了以往的蒸馏和自合成方法。这些结果凸显了演化式CoT合成作为数学推理任务可扩展且有效方法的潜力。
