论文
RKSC:推理感知 KV 缓存共享和多步 LLM 推理的自信提前退出
RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference
摘要
我们引入了 RKSC(推理感知 KV 缓存共享),这是一种 无需训练 推理框架,它消除了多分支 LLM 推理管道中的两个结构冗余。 ASKS(注意力相似度 KV 共享)计算一次前缀 KV 缓存,并通过隐藏状态余弦相似度将其广播到所有语义相似的分支,严格概括 vLLM 和 SGLang 使用的词元精确前缀缓存。 CGEE(置信门控提前退出)应用两种互补的退出机制:(1)当生成置信度在分支中起决定性作用时,它完全跳过验证前向传递;(2)当每层熵稳定时,它在中间层终止验证传递,使用 Transformer 主干上的轻量级钩子。 RSBCM(推理选择性块缓存管理器)通过注意力加权深度优先驱逐来防止缓存无限增长。在五个模型系列 (7B-10B)、四个基准测试和 1,000 个评估问题中,RKSC 比 No-KV 基线(峰值 3.990 倍)平均加速 3.008 倍,比 vLLM 等效前缀缓存平均提高 1.66 倍,CGEE 引起的错误率仅为 0.37%(1,616 个验证调用中有 6 个错误)。不需要 微调 或架构更改。代码可在 https://github.com/AnirudhSekar/RKSC 获取。