论文

YOCO++:通过 KV 剩余连接增强 YOCO,实现高效 LLM 推理

YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference

模型推理KV Cache

摘要

跨层键值 (KV) 压缩已被发现对于 大语言模型 (LLM) 的高效推理非常有效。尽管它们减少了 KV 缓存的内存消耗,但此类方法通常会带来不可忽略的性能下降。在这项工作中,我们的目标是提高 YOCO 的性能,YOCO 是一种跨层 KV 压缩方法,与上半层共享中间层的 KV。我们提出了 YOCO++,这是一种增强的 YOCO,它结合了每个下半层和底层的 KV 之间的加权残差连接。与YOCO相比,YOCO++在保持相同训练和推理效率的同时提高了模型容量。我们的实验表明,YOCO++ 在 50% KV 缓存压缩率下实现了跨层 KV 压缩方法中最先进的性能,优于标准 Transformer。