论文

Kronecker 嵌入:参数高效语言模型的字节级结构化词元表示

Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models

模型架构新型架构

摘要

大语言模型 通过形状 |V| 的学习嵌入表路由每个输入x d_model,在前沿规模上消耗数亿至数十亿个可训练参数。我们引入了 Kronecker Embeddings,这是一种确定性的字节级字符位置分解,用固定编码器和单个学习投影取代了该表,与标准 BPE 标记器兼容,消除了 91--94% 的前沿规模输入端可训练参数。我们提供五项贡献。首先,跨六个 LM(135M-671B 参数)的跨模型探测显示,经过训练的输入嵌入簇探测词的印刷变体远远多于形态相关的变体;克罗内克在嵌入层逃脱了这种聚类。其次,对 nanoGPT GPT-2 124M 与 FineWeb-Edu 的 2.5B 词元进行的受控三种子比较显示,Kronecker 的验证损失比 BPE 相关基线低 2.5 ± 0.2%(差距 0.083 ± 0.007 nat,降低约 9% 的困惑度),需要约 1.43 倍的步骤才能达到 BPE 的收敛损失。第三,对 110 个干净/拼写错误对进行的拼写稳健性调查显示,Kronecker 在 55.5% 的对中保留了前 1 名预测,而 BPE 为 47.3%(+8.2 个百分点),并将 KL 降低了 7.6%,在 11 个类别中的 10 个类别中获胜或平局;生成探针显示 Kronecker 在生成过程中回显字节小说字符串和拼写错误,而 BPE 会忘记它们。第四,BPE 嵌入范数在训练期间发生漂移,而克罗内克投影范数保持在 1.0 附近,与稳定的表征目标一致。第五,动态运行时变体在词汇量 131,072 处从 4.5 MB 字节缓冲区而不是 2.15 GB 表重建嵌入,步进时间开销为 0.01--0.24%。字节级局部性有一个权衡:字节相似但语义上遥远的对(计算/通勤、国家/概念)聚集在一起,将消歧转移到早期的注意力层。