论文

数学推理中的策略可执行性:利用人机差异实现有效引导

Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance

上下文与知识检索增强

摘要

基于示例的引导被广泛用于在推理时改进数学推理,但其效果在不同问题与模型间高度不稳定——即使引导本身正确且与问题相关。我们表明,这种不稳定源于一个此前未被充分探索的差距:策略使用(某推理策略是否出现在成功解答中)与策略可执行性(该策略实例化为目标模型引导时是否仍然有效)之间的差异。通过对配对的人类撰写与模型生成解答的受控分析,我们识别出使用与可执行性之间的系统性分离:人类来源与模型来源的策略以结构化的、依赖领域的方式不同,导致互补优势以及引导下一致的、依赖来源的反转。基于这一诊断,我们提出选择性策略检索(SSR),一个测试时框架,使用经验性的、多路径的、来源感知的信号显式建模可执行性,选择性地检索并组合策略。在多个数学推理基准上,SSR 相比直接求解、上下文学习与单来源引导都带来可靠且一致的改进,紧凑推理模型在 AIME25 上提升最多 +13 分,Apex 上 +5 分。代码与基准发布于 https://github.com/lwd17/strategy-execute-pipeline。

数学推理中的策略可执行性:利用人机差异实现有效引导
图1:一个示例,说明在单独看来有效的策略在作为指导进行迁移时可能会失败。在这道 AIME 级别的问题中,由人类导出的结构性策略与由模型导出的程序性策略各自单独均不充分,而选择性地将二者结合则能成功执行。