论文

HintMR:激发小语言模型更强的数学推理

HintMR: Eliciting Stronger Mathematical Reasoning in Small Language Models

模型推理推理策略与问题分解

摘要

小语言模型(SLM)在复杂数学推理上常常表现不佳,因为其维持长中间步骤链以及从早期错误中恢复的能力有限。为应对这一挑战,我们引入一个提示辅助的推理框架,在多步数学问题求解中逐步引导SLM。我们的方法将解法分解为顺序的推理步骤并提供上下文感知的提示,提示由一个通过从强大语言模型蒸馏训练得到的独立SLM生成。虽然提示生成SLM本身无法解决这些问题,但它与推理SLM的协作能够实现有效引导,构成一个协作式双模型推理系统。每个提示都以题目陈述和累积的推理历史为条件生成,提供逐步、局部的引导而不泄露完整解法。这减少了错误传播,并使推理模型能专注于可处理的子问题。在多样数学基准和模型上的实验表明,提示辅助持续提升SLM的推理准确率,相比标准提示取得可观增益,同时保持模型效率。这些结果凸显了SLM之间经由提示生成与推理形成的结构化协作,是增强数学推理的一种有效且轻量的机制。

HintMR:激发小语言模型更强的数学推理:论文配图
图 1:HintMR 推理概述。 LLM 生成逐步的预言机提示,这些提示被提炼到 SLM 中以实现高效的提示生成。在推理过程中,SLM 求解器使用无提示、LLM 生成的提示或 SLM 生成的提示逐步构建其推理轨迹。虽然 SLM 和 LLM 提示都可以实现正确的解决方案,但 SLM 提示以显着降低的令牌成本实现了相当的性能。