论文

思维之梯:渐进简化推理轨迹的自演化课程

Ladders of Thought: A Self-Evolving Curriculum of Progressively Simplified Reasoning Traces

模型训练合成数据

摘要

大语言模型(LLM)在扩展到数千亿参数时推理表现出色,但中小规模模型即便经过知识蒸馏(KD)仍是脆弱的推理者。我们提出 Ladders-of-Thought(LoT),一个通过渐进式问题改写与自演化课程相结合来提升推理能力的框架。LoT 自动生成语义忠实但更简单的推理问题变体,使用基于步骤的度量将它们组织到难度桶中,并采用自演化的多臂老虎机调度器自适应分配训练。在数学与多跳推理两个领域、跨不同家族的 1—8B 模型上评估,LoT 持续优于知识蒸馏:它在算术任务上带来大幅提升(如 AddSub +32 个百分点、SVAMP +25 个百分点),域内测试集提升 2—8 个百分点,在多跳推理上也有可观但依赖数据集的收益(如 QASC +16 个百分点、StrategyQA +25 个百分点)。LoT 还比分阶段课程收敛更快,凸显了自适应递进的价值。这些结果表明,渐进改写结合自适应课程为增强较小 LLM 的推理能力提供了一个简单而有效的配方。

思维之梯:渐进简化推理轨迹的自演化课程:论文配图
图 1:我们的框架概览。(a) 渐进简化:将原始推理问题改写为语义忠实但难度递减的变体,形成难度阶梯。(b) 基于步骤的难度度量分桶:根据所需推理步骤数为每个问题赋予难度分数,再用该分数将每个样本放入相应桶中。(c) 自进化课程:多臂老虎机调度器自适应地从不同桶中选择样本,以最大化学生的学习进展。