论文

解开 LLM 中的数学推理:内部机制的方法论研究

Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 已经展示了令人印象深刻的功能,但其处理推理密集型任务的内部机制仍未得到充分探索。为了加深对模型内部处理机制的理解,我们通过检查任务执行期间的内部机制来研究 LLM 如何执行算术运算。使用早期解码,我们跟踪如何跨层构建下一个词元预测。我们的实验表明,虽然模型很早就识别算术任务,但正确的结果生成仅发生在最后一层。值得注意的是,精通算术的模型在注意力和 MLP 模块之间表现出明确的分工,其中注意力传播输入信息,MLP 模块聚合它。在不太熟练的模型中不存在这种划分。此外,成功的模型似乎能够在功能上处理更具挑战性的算术任务,这表明推理能力超出了事实回忆。