论文

生命周期最优标记化:词汇量大小作为依赖于部署机制的基础设施参数

Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter

模型推理推理加速

摘要

分词器词汇量是 大语言模型 (LLM) 基础设施中的基本设计选择,但它通常根据约定而不是部署分析在训练时固定。我们表明,成本最优词汇不是一个常数,而是服务制度的函数。我们将总部署成本形式化为 $C_{lifecycle}(V) = C_{train}(V) + λ\cdot C_{infer}(V, B)$,其中 $λ$ 是推理量,$B$ 是服务批量大小。通过对跨越内存绑定到计算绑定机制的两个 GPU 系列(A10G,ridge $\approx$ 117 FLOP/byte;A100,ridge $\approx$ 183 FLOP/byte)进行受控实验,我们演示了:(1) 推理最佳词汇量随着服务批次的变化而变化 16 倍,从 $B=1$ 时的 32k 到 $B=64+$ 时的 524k,由读取的 $V \times d$ 去嵌入矩阵的摊销驱动; (2) 在 1.3-2.3B 模型规模下,质量(每字节位数,BPB)在 $V=65$k 处优化,确认了规模相关的词汇偏好; (3) 对于生产部署,生命周期最佳词汇与训练最佳词汇的差异高达 16 倍。质量在最佳范围内大致保持不变($<$2% BPB 分布),使词汇成为纯粹的系统优化,在测量范围内没有质量损失。我们的结果提供了可行的容量规划指导:设备上部署 ($B=1$) 应使用 $V \大约 32$k;数据中心服务($B \geq 64$、$λ\geq 10$)应使用 $V \approx 131$-262k。