论文

大语言模型 作为词元压缩器和解压缩器

Large Language Model as Token Compressor and Decompressor

上下文与知识上下文工程

摘要

在本文中,我们研究了现成的 LLM 是否可以改编成离散的、可变长度的词元压缩器和解压缩器,以进行长上下文处理。为此,我们设计了一个自我表达的自动编码框架,该框架使用轻量级 LoRA 适配器对预训练的 LLM 进行微调,将长文本映射到学习的潜在代码的紧凑序列(称为 Z 词元)中,并将其解码回自然语言或任务输出。由此产生的表示是内容自适应的:可预测性较低或信息密集的片段可以接收更多的 Z 词元,而冗余区域可以通过预算感知长度正则化器更紧凑地表示。我们的方法在维基百科、CNN/DailyMail、HotpotQA 和 QuALITY 等长上下文数据集上进行了评估,结果表明它保留了重建质量和下游性能,同时减少了有效上下文长度、生成阶段内存使用和端到端延迟。这种简单的设计支持从压缩上下文直接解码和 Z 词元空间中的自回归生成,为高效的长上下文推理提供了实用的接口。