论文

压缩潜在嵌入空间中的序列:大语言模型 的 $K$-词元合并

Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models

上下文与知识上下文工程

摘要

大语言模型 (LLM) 在处理长提示时会产生大量的计算和内存成本,因为完全自注意力随输入长度呈二次方缩放。词元压缩旨在通过减少表示输入的词元数量来解决这一挑战。然而,现有的即时压缩方法主要在词元空间中运行,而忽略了潜在嵌入空间中的低效率。在本文中,我们提出了 K-Token Merging,这是一种潜在空间压缩框架,它通过轻量级编码器将 K 个 token 嵌入的每个连续块合并为单个嵌入。压缩序列由 LoRA 适配的 LLM 处理,而生成仍保留在原始词汇中。结构推理(Textualized Tree)、情感分类(Amazon Reviews)和代码编辑(CommitPackFT)的实验表明,K-Token Merging 位于性能与压缩的 Pareto 前沿,实现了高达 75% 的输入长度减少,同时性能下降最小。代码可在 https://github.com/shsjxzh/K-Token-Merging 获取。