论文
MILO:使用逐块低秩压缩进行高效的多镜头上下文学习
MILO: Efficient Many-shot In-Context Learning with Block-wise Low-rank Compression
摘要
多镜头上下文学习(ICL)使大型语言模型(LLM)能够通过数千个演示示例来适应复杂的任务,但这种范式将推理效率瓶颈转移到了键值(KV)缓存。由于 KV 缓存的线性扩展行为,存储这些中间张量已成为在线服务和设备上部署的首要挑战。为了解决这个问题,我们提出了一种新颖的压缩框架,称为 MILO,它利用了多镜头上下文中固有的低秩冗余。具体来说,MILO 采用逐块低秩压缩策略,以块粒度压缩 KV 缓存,其中每个块包含多个多镜头示例。此外,为了处理不同块之间的异构上下文密度,MILO 根据信息熵动态分配排名预算,在保留关键块的保真度的同时积极压缩冗余块。 Qwen2.5 模型的实验结果表明,我们的方法实现了 KV 缓存内存减少高达 50% 和吞吐量提高 1.8 倍,分类和推理基准的性能下降可以忽略不计,显着优于之前的基准。