论文

STOP:低数据状态下长形式推理的结构化 同策略 修剪

STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes

模型推理推理策略与问题分解

摘要

长思维链 (Long CoT) 推理提高了多步骤问题的性能,但也会导致过度思考。这种低效率在低数据 微调 体系中尤其成问题,其中实际应用程序在有限的监督下适应推理模型,并且不能依赖大规模教师 蒸馏 或严格的测试时间控制。为了解决这个问题,我们提出了 STOP(结构化 同策略 修剪),这是一种用于分析和修剪长形式推理轨迹的 同策略 算法。 STOP 从模型构建自蒸馏轨迹。然后,它通过节点分段、分类注释和推理树构建将每个跟踪映射到结构化推理接口。在此接口之上,我们引入了ECN(最早正确节点),它保留了以最早节点结束的最短前缀。在 GSM8K、Math 500 和 AIME 2024 上的 DeepSeek-R1-Distill-Qwen-7B 和 DeepSeek-R1-Distill-LLaMA-3-8B 上进行的实验表明,STOP 将生成的词元减少了 19.4% 至 42.4%,同时在很大程度上保持了低数据 微调 的准确性。除了效率之外,我们的分析表明,与教师指导的修剪相比,STOP 引起的分配变化要小得多,提高了生成推理的结构效率,并将推理工作从冗余验证和回溯中重新分配到更富有成效的探索。