论文
DEL:大语言模型 数值学习的数字熵损失
DEL: Digit Entropy Loss for Numerical Learning of Large Language Models
摘要
数字预测是 大语言模型 (LLM) 在数学问题解决和代码生成方面的基本功能。 LLM 训练中广泛采用的最大似然估计 (MLE) 不适用于数字预测。最近,惩罚驱动的方法,例如数字词元损失和离散距离损失,引入了数值距离的归纳偏差,但分别引起过度锐化和过度平坦的数字分布。在本文中,我们对LLM数值学习进行了深入分析,表明现有的数值学习方法在概念上遵循标准距离公式,其中标准项代表优化模式,距离项灌输几何先验。因此,我们提出了用于自回归数值学习的数字熵损失(DEL),它在三个关键设计中重新表述了传统的无监督熵优化:利用数字条件概率和二元交叉熵将熵优化引导为有监督的方式;弃用距离项以绕过数值距离问题;并将基于整数的数值学习推广到浮点数优化,从而实现更准确的数字预测。我们的 DEL 公式可以包含整数、小数和小数点,将学习目标从单个数字扩展到浮点数域。使用四个具有代表性的 LLM(包括 CodeLlama、Mistral、DeepSeek 和 Qwen-2.5)在七个数学推理基准上进行的实验表明,DEL 在整体预测精度和数值距离方面始终优于其同行。源代码位于 https://github.com/PolyU-VCLab/DEL