论文

数学推理中思维链的SHAPE

SHAPE of Chain-of-Thought in Math Reasoning

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 在数学推理基准上取得了出色的表现,但其推理背后的数学意义技能仍未得到充分探索。我们引入 \texttt{SHAPE},一个通过数学教育中开发的两个镜头来分析思想链(CoT)轨迹的框架:(1)语义空间:模型对问题的不断发展的数学解释(例如代数、几何),以及(2)启发式:在这些空间内采取的具体数学行动(例如,简化问题、逆向工作)。我们首先使用\texttt{SHAPE}来分析各种模型的推理模式。我们的研究结果表明,模型采用的数学启发式比传统的 CoT 特征更好地解释了最终答案的正确性。此外,模型很可能通过将推理工作集中在几个语义空间内而不是探索许多不同的空间来得出正确的解决方案——这是与人类行为一致的模式。接下来,我们利用 \texttt{SHAPE} 镜头来评估训练后是否真正提高了数学能力。我们发现强化学习会引发启发式使用中的模式寻求。最后,我们通过促进多样化启发法对LLM进行后训练,并证明其在提高准确性方面的有效性。总体而言,\texttt{SHAPE} 为解码 LLM 推理提供了一个有理论基础的诊断框架,并为数学推理的训练后 LLM 提供了一条新途径。我们模型的代码位于 https://github.com/holi-lab/SHAPE-of-CoT

数学推理中思维链的SHAPE:论文配图
图1:合成COT痕量所用的SHAPE说明实例。求解器首先设置代数配方(空间1),引入一个方程式系统。然后,它放弃了这一方法,转而采用基于试验的计算战略(空间2)。最后,它返回代数配方(空间1)并解决了系统。我们把每一种解决问题的解释都称为语义空间——一种由模型所采用的物体、目标和制约因素所定义的不同数学解释。在每个空间内,单步都标记为超常-目的性数学动作,例如引入一种表示(H3a)或探索特定案例(H9a),或者标为非超常步骤,如说明答案(N4)。箭头标记这些空格之间的转换。完整的休养分类,见附录A。