论文

Aha-Flow 蒸馏:流标记在 LLM 推理中很重要

Aha-Flow Distillation: Flow Markers Matter in LLM Reasoning

模型训练监督微调与指令调优

摘要

我们确定了“心流时刻”,这是一种推理模式,其特征是持续的、过程确认的语言表达,就像我正在做的那样,与以修正和回溯为导向的顿悟时刻形成鲜明对比。我们将它们相应的语言表达分别称为 Flow Markers 和 Aha Markers。基于这一观察,我们通过重写原始推理痕迹的话语标记同时保留其底层推理内容来构建Flow-CoT,并将其用作同策略 self-蒸馏(OPSD)的辅助监督。我们进一步提出 \textbf{Aha-Flow 蒸馏 (AFD)},这是 OPSD 的双模式扩展,它将不同形式的特权信息与相应的推理指令配对。 Aha 分支保留了简洁的基于解决方案的监督,而 Flow 分支则在直接且自信的推理指令下引入了重写的 Flow-CoT。在推理时,模型仅使用标准反射指令,因此流式推理纯粹用作训练信号。 AIME25 和 HMMT25 的实验显示 Qwen3-8B 和 Qwen3-4B 都有一致的改进:与我们复制的 OPSD 基线相比,AFD 将 Qwen3-8B 上的 Avg@12 从 60.8 提高到 61.3,将 Qwen3-4B 上的 Avg@12 从 57.5 提高到 58.6。受控消融进一步表明,在相同的 Flow-CoT/Aha-CoT 组成下,双模式训练将 Avg@12 从 59.5 提高到 60.1,这表明好处不仅来自引入异构推理监督,还来自自 蒸馏 期间的组织方式。代码可在 https://github.com/Wang-Xiaodong1899/Aha-Flow-蒸馏 获取。