论文

用于数值推理的三元后缀标记化方案

A Triadic Suffix Tokenization Scheme for Numerical Reasoning

模型训练预训练

摘要

标准子字标记化方法对数字进行分段不一致,导致 大语言模型 (LLM) 丢失位置和十进制结构 - 这是算术和科学推理中错误的主要驱动因素。我们引入了三元后缀标记化(TST),这是一种确定性方案,它将数字划分为三位数的三元组,并用明确的幅度标记来注释每个三元组。重要的是,该方案定义了整数部分(千、百万、十亿等)的后缀和数量级之间的固定、一对一的映射,以及分数深度(十分之一、千分之几、百万分之几等)的复制标记的并行系统。与依赖位置推断的方法不同,该方法提供一致的梯度信号,这应确保稳定的收敛。提出了两种实现变体:(1)基于词汇表的方法,向现有词汇表添加最多 10,000 个固定标记,涵盖 33 个数量级($10^{-15}$ 到 $10^{18}$); (2) 后缀标记方法,使用一小组特殊标记来动态表示幅度。两种变体都保留精确的数字,同时使 词元级 上的数量级关系透明。虽然我们专注于 3 位数字组 (Triadic),但该框架本质上可以扩展到任何组大小,以实现精确的词汇优化。此外,它允许线性词汇扩展以适应任意精度和范围。 TST 与体系结构无关,可以作为直接预处理步骤进行集成。实验验证推迟到未来的工作。