论文
语义缓存 蒸馏:通过重用和选择性修补实现高效状态传输
Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching
摘要
分解服务缓解了 大语言模型 (LLM) 推理中的内存瓶颈,但造成了严重的通信瓶颈:传输高维键值 (KV) 缓存通常会主导首次词元时间 (TTFT)。此外,跨异构模型(例如,基础和微调变体)重用缓存会导致语义错位,并在各层上累积,从而降低生成质量。我们提出语义缓存 蒸馏 (SCD),这是一种损失约束框架,用紧凑的语义代码取代原始 KV 传输。 SCD 通过两种机制解决这些挑战:(1) 重用,从低秩子空间重建大多数层以最小化传输成本;(2) 补丁,预测稀疏过渡层的归一化输入以截断错误传播。根据经验,SCD 比预言机消费者预填充提供高达 2.65 $\times$ TTFT 加速,并在带宽受限的情况下在质量延迟帕累托前沿上主导量化和选择性重新计算基线,同时将生成质量保持在预言机的 5\% F1 范围内。