论文

没有可训练输入嵌入表的语言模型:从固定的最小二进制词元代码中学习

Language Models Without a Trainable Input Embedding Table: Learning from Fixed Minimal Binary Token Codes

模型架构Transformer

摘要

可训练的输入嵌入表是现代语言模型的标准组件。我们在输入界面询问它们是否真的有必要。对于大小为 $V$ 的词汇表,精确的标记标识仅需要 $K=\lceil \log_2 V\rceil$ 位。我们用固定的最小二进制标记代码和模型宽度的零参数提升来替换通常的可训练 $V\times d_{\text{model}}$ 输入嵌入矩阵。在我们的主要设置中,$V=65{,}536$,因此$K=16$,并且词元由平铺到$d_{\text{model}}=1024$的固定16维二进制代码表示。我们还评估了一个完全无表的变体,其中代码是动态地从词元 ID 生成的,并通过 $\mathbb{F}_2^K$ 上的可逆仿射变换随机重新编码。在匹配的 32 层仅解码器模型上训练大约 17B 个词元并通过三个独立训练种子进行评估,固定最小代码实现了与标准学习输入基线相当的保留验证困惑度,同时删除了 6710 万个可训练输入参数。在我们的实验中,固定代码运行的平均验证困惑度较低,分别为 2.36 与 2.44,但观察到的差距在测量的种子间变异 4.8% 之内;因此,我们将结果解释为可训练输入表不是必需的证据,而不是统计上解决的优越性主张。尽管训练运行时间稍短,但无表仿射记录变体仍接近 2.39。这些结果表明,在这种情况下,可训练的输入嵌入表对于有用的语言建模来说并不是必需的。输出投影保持标准且可训练。