论文

RedKnot:具有头感知KV复用与分段的高效长上下文LLM服务

RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

模型推理KV Cache

摘要

随着大语言模型(LLM)服务的输入长度不断增长,KV缓存已成为AI基础设施的主要瓶颈。它限制了 GPU 内存容量、服务并发性、缓存重用和分布式可扩展性。多个重要问题,包括位置无关的 KV 缓存、前缀 KV 缓存压缩、热/冷 KV 缓存分离以及分布式 KV 缓存管理,都取决于 KV 缓存的表示和管理方式。然而,现有的服务系统在很大程度上依赖于整体的 KV 缓存抽象,其中 KV 缓存被视为词元级内存块的同质序列,并在注意力头和服务场景中使用类似的策略进行管理。我们观察到 KV 缓存实用程序在 KV 头之间是高度结构化的:不同的头表现出不同的功能角色、注意力距离和运行时重要性。因此,对于每个头、词元范围或服务场景,并不总是需要完整的 KV 缓存。我们推出了 RedKnot,一个用于 LLM 服务的头部感知 KV 缓存管理系统。 RedKnot 通过沿着 KV 头分解 KV 缓存,打破了传统的整体 KV 缓存抽象,其重要性和有效关注范围在不同的服务场景中存在显着差异。这种头级分解将 KV 缓存从整体张量抽象转变为结构化内存对象,使 RedKnot 能够统一支持位置无关的 KV 重用、前缀 KV 压缩、热/冷 KV 分离和分布式 KV 放置,同时保留输出保真度并提高资源效率,无需模型重新训练或微调。 RedKnot 通过将 KV 缓存从单一的、被动的运行时工件转变为动态的、模型感知的运行时基础来实现可扩展的 LLM 服务,为 AI 基础设施奠定了新的基础。

RedKnot:具有头感知KV复用与分段的高效长上下文LLM服务:论文配图
图 5:RedKnot 概述。