论文
通过推理过程错误分类提高大型语言模型的数学推理能力
Improving Mathematical Reasoning Capabilities in Large Language Models via Reasoning Process Error Classification
摘要
大语言模型(LLM)的推理能力是基于 LLM 的实际应用的关键因素。为了研究大语言模型当前的推理能力,我们澄清了大语言模型在数学数据集的推理过程中出现的错误类型。我们专注于大语言模型给出错误答案的问题。我们将推理过程中的错误定义为推理错误,并人工分析推理错误的特征。我们定义并分类了 21 个错误类别,并确定了其中经常出现的类别。除了定性评估之外,我们还利用评估结果来提高推理能力。我们设计了一个明确关注八个错误类别的提示。实验表明,该提示有效提高了推理能力。此外,结果表明,本文中发现的常见推理错误在同等规模的大语言模型中很常见。