论文
FutureMind:通过自适应知识蒸馏为小语言模型装备策略性思维模式先验
FutureMind: Equipping Small Language Models with Strategic Thinking-Pattern Priors via Adaptive Knowledge Distillation
摘要
小语言模型(SLM)因其高效、低时延的推理而对成本敏感与资源受限的场景具有吸引力。然而,它们在需要结构化推理与有效检索的复杂、知识密集型任务上常常表现吃力。为解决这些局限,我们提出 FutureMind,一个模块化推理框架,通过从大语言模型(LLM)的自适应知识蒸馏为 SLM 装备策略性思维模式先验。FutureMind 引入由四个关键模块组成的动态推理流水线:问题分析、逻辑推理、策略规划与检索引导。该流水线由三种不同的检索范式增强,把复杂查询分解为可处理的子问题,确保检索执行高效而准确。在多跳问答基准(包括 2WikiMultihopQA、MuSiQue、Bamboogle 与 Frames)上的大量实验证明了 FutureMind 的优越性。它在免训练条件下持续超越 Search-o1 等强基线,在多样 SLM 架构与规模上取得最先进结果。除经验增益外,我们的分析揭示,思维模式蒸馏过程受限于教师(LLM)与学生(SLM)模型之间的认知偏差瓶颈。这为推理技能的可迁移性提供了新视角,为发展兼具效率与真实认知能力的 SLM 铺平道路。
