论文

从抽象到情境:LLM在数学上仍做不到什么

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

模型评测基准与评测资源

摘要

大语言模型现已能以接近专家的水平求解许多基准数学题,但这一进步尚未完全转化为真实应用中的可靠表现。我们通过情境数学推理研究这一差距——其中数学内核必须从描述性场景中构造出来。我们提出ContextMATH,一个把AIME与MATH-500问题改造为两种情境设置的基准:情境落地(SG),把抽象问题嵌入现实叙事而不增加推理复杂度;复杂度缩放(CS),把显式条件转化为子问题,以捕捉约束在实践中常见的出现方式。评估61个专有与开源模型,我们观察到急剧下滑:平均而言,开源模型在SG与CS上分别下降13分与34分,专有模型分别下降13分与20分。错误分析显示,错误主要由不正确的问题构造主导,且构造准确率随原始问题难度上升而下降。正确构造成为成功的前提,其充分性随模型规模提升,表明更大的模型在理解与推理两方面均有进步。尽管如此,构造与推理仍是限制情境数学问题求解的两个互补瓶颈。最后,我们发现用场景数据微调能提升性能,而仅做构造训练无效。然而,性能差距只是部分缓解,凸显情境数学推理是LLM尚待解决的核心挑战。

从抽象到情境:LLM在数学上仍做不到什么
图1:ContextMATH 示例,基于 AIME 2025 Problem 15。在 Scenario Grounding(SG)中,数学组件被映射到一个叙事中。在 Complexity Scaling(CS)中,显式条件被隐藏在需要额外推理步骤的子问题中。一致的颜色编码突出三个版本之间数学组件的对应关系。LLM 在抽象基准上表现强劲,但在 SG 上准确率下降,且在 CS 上差距进一步扩大。