论文

SenseMath:LLM有数字感吗?评估捷径使用、判断与生成

SenseMath: Do LLMs Have Number Sense? Evaluating Shortcut Use, Judgment, and Generation

模型评测基准与评测资源

摘要

即使存在高效的数值捷径,大语言模型也常常默认进行逐步计算。这引出一个基本问题:它们是否表现出人类行为意义上的数字感,即识别数值结构、在恰当时运用捷径、在不恰当时避开捷径的能力?我们提出SenseMath,一个用于评估LLM结构敏感数值推理的受控基准。SenseMath包含4800个条目,横跨八个捷径类别与四个位数规模,并配有匹配的强捷径、弱捷径与对照变体。它支持认知要求递增的三种评估设置:捷径使用(模型能否在适合捷径的问题上应用捷径)、适用性判断(能否识别捷径何时适用、何时具有误导性)与问题生成(能否生成正确适配给定捷径类型的新题目)。我们对从GPT-4o-mini到Llama-3.1-8B的五个LLM的评估显示出一致模式:在明确提示时,模型乐于采用捷径策略并在适合捷径的题目上取得大幅准确率提升(最高15%);但在标准思维链提示下,它们自发运用此类策略的案例不足40%,即便它们显然具备相应能力。此外,这种能力仅限于使用层面;模型系统性地把捷径过度泛化到不适用的题目上,且无法从零生成有效的含捷径题目。综合来看,这些结果表明当前LLM表现出程序性捷径熟练度,却缺乏对捷径何时、为何有效的结构性理解,而后者正是人类数字感的根基。

SenseMath:LLM有数字感吗?评估捷径使用、判断与生成:论文配图
图1:SenseMath:每题配强捷径、弱捷径与对照变体,在CoT与数感提示下作答,匹配设计区分选择性捷径利用与一般提示效应。