论文

FlexComp:上下文压缩中每个比率的一个模型

FlexComp: One Model for Every Ratio in Context Compression

上下文与知识上下文工程

摘要

软上下文压缩将上下文压缩为几个内存词元,冻结的 LLM 会消耗这些内存词元来代替原始文本,但现有压缩器在训练和推理时固定压缩比:每个部署的比率都需要单独训练的模型,并且所选的比率统一应用于所有输入,而其实际需求差异很大。我们提出了 FlexComp,一种与方法无关的框架,它将比率与训练和部署解耦:俄罗斯套娃式训练对每个实例的内存预算 $K$ 进行采样,将一个模型转变为任意比率压缩器,然后通过以下方式选择每个输入的预算:(1) 基于置信度的级联路由或 (2) 轻量级学习的 $K$ 预测器。在 MRQA 上的 ICAE、500xCompressor 和 SAC 中,单个 FlexComp 模型可以与单独训练的固定比率专家相匹配,同时降级最小。级联路由在高达 266 倍的平均压缩率下保留了超过 98% 的最温和比率的准确性; $K$ 预测器在单次压缩解码过程中,在最温和比率的 0.7 F1 范围内达到 158-236 倍。在服务规模批量大小下,$K$ 预测器将上下文 KV 缓存减少了 50%,并将解码吞吐量提高了 47%。