论文
缺失的原语:诊断和修复大语言模型中的数学推理
The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning in Large Language Models
摘要
虽然大语言模型(LLM)在前沿数学问题上表现出了惊人的能力,但仍不清楚它们是否拥有其解决方案背后的结构性数学理解。在本文中,我们朝着系统地研究大语言模型的数学理解迈出了第一步,从诊断其独特的能力到利用这些发现来改进后训练的能力。首先,我们引入数学原语的概念来探索结构数学理解,并提出 \hlei{},这是一种新颖的基准,可以沿着四个不同的维度评估数学推理:发现、生成、消化和执行。其次,我们的系统诊断表明,解决方案的准确性掩盖了不同的能力概况,基元释放了大量的潜在执行能力,而发现是数学推理中的主要瓶颈。我们的后训练分析进一步表明,发现有限的故障特别容易修复。最后,基于这些发现,我们引入了 \abs{},一种原始特权自蒸馏框架,可选择性地将原始引导推理转移到学生模型中。大量实验表明,\abs{} 在跨模型规模和挑战性基准的基础上持续改进数学推理。