论文

ThinkSwitch:具有 LoRA 和权重插值的上下文 蒸馏 用于特定目的推理任务

ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks

摘要

大语言模型 通常通过在产生最终答案之前在推理跟踪上花费推理时间计算来改进困难的任务。这种额外的计算可能很有用,但它也会增加延迟、词元成本和部署复杂性。我们引入了 \textbf{ThinkSwitch},这是一种用于协同训练配对指令和思维检查点的低计算程序。从兼容的Qwen3-4B指令和思维模型开始,每次迭代都要求思维检查点生成答案,删除推理痕迹,用QLoRA将仅答案对提取到指令检查点,并通过球形权重插值重建思维检查点。人类提供的唯一输入是任务提示;标签由模型本身生成。在包含 30 个问题的 AIME 2026 评估中,ThinkSwitch 将指令检查点从 10/30 改进到 20/30,将思维检查点从 14/30 改进到 22/30。在 30 个问题的 PubMedQA 子集中,它将指导检查点从 13/30 改进到 18/30,将思维检查点从 18/30 改进到 25/30。完整的实验每个域使用 15 个训练提示,在单个云 RTX 3070 上的成本为 2.86 美元。结果规模较小,但它们表明有针对性的 蒸馏 循环可以将显式推理的部分好处转化为权重,同时保留单独的思维模式。