论文

语言模型需要可训练输入嵌入表吗?1.7B 规模固定最小 token 编码实验

Do Language Models Need a Trainable Input Embedding Table? Fixed Minimal Token Codes at 1.7B-Class Scale

模型架构新型架构

摘要

可训练输入嵌入表为每个词汇项分配一个独立可调的向量。我们研究了这种特定于 token 的参数化是否是实质性语言建模能力所必需的,或者共享 Transformer 是否可以从固定的 token 身份中学习。我们比较了使用相同分词器、上下文骨干模型、不共享输入输出权重的输出头架构和训练配方从头开始训练的三种仅解码器语言模型,每个模型的目标预算为 1000 亿个预测 token。它们的输入接口是一张学习表、规范的 16 位 token-ID 代码和一个基于 GF(2) 的固定可逆重新编码。固定代码会重复到模型宽度,无需额外的可训练输入投影。两种固定代码模型都获得了强大的功能:规范代码实现了 52.40% HellaSwag 标准化精度、70.51% PIQA 精度和 42.75% LAMBADA 精度。学习输入控制在包括 HellaSwag 和 LAMBADA 在内的多项评估中表现更好,因此这些结果确定了可行性而不是性能平等。固定接口删除了 1.007 亿个可训练参数,产生 1.711B-参数模型,但参数减少并不是主要结果。这些单次运行实验区分了架构必要性和经验实用性:观察到的功能不需要独立的可训练 token 特定输入向量。固定身份接口还提供了一种受控设置,用于研究不可变输入下游的表示学习,而无需确定特定能力位于何处。