论文
从抽象到情境:LLM在数学上仍做不到什么
From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics
摘要
大语言模型现已能以接近专家的水平求解许多基准数学题,但这一进步尚未完全转化为真实应用中的可靠表现。我们通过情境数学推理研究这一差距——其中数学内核必须从描述性场景中构造出来。我们提出ContextMATH,一个把AIME与MATH-500问题改造为两种情境设置的基准:情境落地(SG),把抽象问题嵌入现实叙事而不增加推理复杂度;复杂度缩放(CS),把显式条件转化为子问题,以捕捉约束在实践中常见的出现方式。评估61个专有与开源模型,我们观察到急剧下滑:平均而言,开源模型在SG与CS上分别下降13分与34分,专有模型分别下降13分与20分。错误分析显示,错误主要由不正确的问题构造主导,且构造准确率随原始问题难度上升而下降。正确构造成为成功的前提,其充分性随模型规模提升,表明更大的模型在理解与推理两方面均有进步。尽管如此,构造与推理仍是限制情境数学问题求解的两个互补瓶颈。最后,我们发现用场景数据微调能提升性能,而仅做构造训练无效。然而,性能差距只是部分缓解,凸显情境数学推理是LLM尚待解决的核心挑战。
