论文
将长上下文压缩为答案对齐的内存嵌入以用于 LLM 推理
Compressing Long Context into Answer-Aligned Memory Embeddings for LLM Inference
摘要
大型语言模型 (LLM) 推理受到自注意力的二次缩放和 KV 缓存的线性缩放的限制,随着上下文长度的增加,延迟、能耗和 GPU 内存需求也会增加。现有的软压缩方法要么在推理时缺乏查询引导的内存选择,要么在没有以答案为目标的监督的情况下进行训练,要么将压缩与特定的解码器架构紧密结合。我们提出了一种上下文到答案对齐的内存压缩(CMC)框架,它将长输入上下文压缩为与任何冻结解码器的嵌入空间对齐的紧凑上下文内存嵌入(CME),从而在不修改解码器权重的情况下降低推理成本。 CMC 引入了两层 KV 缓存,它将问题引导的 CME 选择与本地上下文窗口相结合,并通过从冻结的 LLM 中以答案为目标的蒸馏来训练压缩器。九个编码器-解码器组合和四个 QA 基准测试的实验表明,CMC 始终优于基线,在 SQuAD 上实现了高达 7.3 EM 和 4.0 F1 点增益,同时在 3,000 个生成词元时将推理时间和能耗减少了高达 20%,并将峰值保留 GPU 内存减少了高达 50%。消融研究证实,每个架构组件和训练目标都对性能有所贡献。