论文

数学应用题求解的四阶段分解与大模型推理的机制脆弱性

A Four-Stage Decomposition of Word-Problem Solving and Mechanistic Fragility in LLM Math Reasoning

模型评测模型行为与机制分析

摘要

大语言模型能高准确率解决小学数学应用题,却可能因插入一句无关从句而表现崩溃。我们用机制解释调和这两种观察,显示模型内部计算分解为四阶段顺序流水线:模式抽象、运算规划、操作数绑定和计算。各阶段在可识别的层区间产生不同中间表示。用同一框架诊断干扰导致的失败,我们将损坏定位到单一的运算规划阶段;该阶段由一组注意力头实现,其因果作用通过双向验证确认。我们由此提供对大模型数学应用题推理及其受干扰失败的机制解释。

数学应用题求解的四阶段分解与大模型推理的机制脆弱性:论文配图
图9:在带思维链提示的助手头位置、尚未生成推理前进行线性存在性探测。第22层重新出现实体下降、运算符上升的分离现象,但下降幅度小于决策位置,与阶段电路在输出承诺位置作用更强的解释一致。此处未出现第三阶段数字Token或第四阶段最终答案特征,与绑定及计算发生在思维链生成期间的解释相符。