论文

LLM的数学推理按方法组织,而非按主题

Math Reasoning in LLMs is Organized by Approach, Not Topic

模型评测模型行为与机制分析

摘要

数学推理基准通常按主题组织,但语言模型可能改为按可复用的推理方法来组织其内部计算。本文考察开放的具备数学能力的LLM究竟是按主题子技能还是按推理方法组织内部结构,并给出证据表明方法才是关键。我们提出生成-回放协议:模型先生成一个解答,然后我们精确回放“提示加生成”的轨迹,并提取推理token上的激活重要性签名。我们在八个模型与五个数学推理来源上对这些签名进行无监督聚类,再用结构、语义与干预测试评估所恢复的结构。在全部40个模型-来源组合中,恢复出的聚类都优于同等规模的随机基线。两个独立的前沿LLM裁判在77%—82%的真实聚类中发现方法级一致性,而来源内对照中仅为6%—11%;且主题纯净的聚类通常获得比主题本身更细的标签。在方法受控提示下,改变所要求的推理方法会在八个模型条件中的七个里改变聚类归属,而改写措辞基本不改变归属。这些结果表明,具备数学能力的LLM按推理方法而非基准主题组织其内部数学计算。其含义是:按主题分层的基准与主题均衡的训练语料仍可能错过真正重要的轴——即使刻意主题均衡的语料,在推理方法上也可能失衡。