论文
Draft-Thinking:在长思维链LLM中学习高效推理
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
摘要
长思维链(CoT)已成为增强大型推理模型(LRM)推理能力的主流范式;然而,性能收益往往伴随推理预算的大幅增加。近期研究表明,现有CoT范式容易诱发系统性过度思考,不必要地把推理能力与推理成本耦合。多数先前方法通过token压缩、截断或长度惩罚等事后技术减少token使用,而没有显式处理推理的核心机制。我们提出Draft-Thinking,引导模型首先学习一种只保留关键推理步骤的简洁草稿式推理结构。通过渐进式课程学习,模型随能力扩展稳定地内化这一高效推理模式。此外,Draft-Thinking引入自适应提示,把推理深度提升为灵活的、可由模型选择的行为。大量实验表明,Draft-Thinking在大幅保持推理性能的同时显著减少推理预算;例如,在MATH500上,它以仅2.6%的性能下降换来82.6%的推理预算削减。
