论文
大语言模型的数值能力:根本局限与改进路径
Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement
摘要
大语言模型(LLM)在数学推理基准上取得优异成绩,但在基础数值任务上仍不可靠,包括数量级比较、大整数算术、分数与科学记数法。本综述将基础数值理解视为一种有别于高层级数学推理的能力加以考察。我们提出数值锚定框架(NGF),将数值能力分解为表示锚定(RG,将数字形式映射到数值、量级与等价表示)与程序锚定(PG,按数学定义执行算术运算)。借助NGF,我们组织了近期的诊断基准、失败模式、结构性解释与缓解策略。我们综述了有关分词(tokenization)、位置编码、嵌入几何与预训练数据分布的证据。我们还在Number Cookbook、NumericBench与GSM-Symbolic上对三个前沿模型族进行了协调评估,比较原子级、情境化与推理辅助的数值能力。数字感知分词与Abacus Embeddings等架构干预可以改进从零训练的模型,但对预训练系统的使用者通常不可得,对他们而言,有监督微调、推理脚手架与外部工具更为实用。最后我们给出部署建议与研究方向,以实现基础模型更可靠的数值行为。
