论文
提炼 Transformer 语言模型中的顺序计算
Distilling Sequential Computation in Transformer Language Models
摘要
Transformer 语言模型以自回归方式逐个标记地处理序列,使得不断增长的上下文变得越来越昂贵。然而,许多相邻的词元跨度是高度可预测的或经常作为稳定单元出现,这表明它们的表示可能是可压缩的。我们引入了一种通过用折叠表示替换输入标记的范围来提取顺序计算的方法,并由轻量级合并模块即时计算。该模块从一系列静态词元嵌入序列生成单个代理嵌入,捕获多个词元的功能角色,允许预训练模型在压缩输入上运行,而无需进行架构更改或重新训练。我们在推理过程中应用这种方法来压缩提示和中间解码步骤,使用回滚机制用单步代理替换存储的多词元 KV 缓存条目。跨不同模型的实验表明,合并模块可用于将有效序列长度减少多达 40%,同时将语言建模评估和下游任务(包括问答、摘要、常识推理和长式数学推理)的准确性降幅降至最低。合并模块的额外轻量级适配进一步改善了所选设置中的精度-压缩权衡。这些结果表明,Transformers 中的顺序词元计算可以通过压缩代理表示来有效地近似,这些代理表示无需模型更新即可近似原始行为。