论文

Pallas:AI-RAN 中 LLM 推理的主动 KV 缓存迁移框架

Pallas: A Proactive KV Cache Migration Framework for LLM Inference in AI-RAN

AI 基础设施推理服务

摘要

AI-RAN 使 大语言模型 (LLM) 服务靠近移动用户,但蜂窝切换可以将活动请求与其推理状态分开:用户连接到目标基站 (gNB),而大型且不断增长的键值 (KV) 缓存仍保留在源处。在源端保留推理可以保持服务连续性,但会持续增加词元间延迟(ITL),而在目标端恢复状态可以恢复服务局部性,但仅在切换后才需要 KV 缓存传输、重新计算或两者的组合,直接延长服务中断时间(SIT)。这项工作提出了 Pallas,一个 \textit{proactive} KV 缓存迁移框架,它在切换之前准备预测目标的推理状态,与正在进行的源端推理和词元传递并行。在准备触发时,Pallas 将词元序列划分为稳定的历史前缀和不断发展的后缀。目标通过本地预填充重建前缀,而源流传输为后缀生成的 KV 块。切换时,目标将这两个部分组装到最新的 KV 缓存中,并在本地恢复解码,只留下未完成的准备工作以贡献于 SIT。在线调度程序选择 \textit{预取窗口},它根据移动性预测和运行时遥测确定切换前如何提前准备。在三个 LLM 和 $100$--$500~\mathrm{Mbps}$ gNB 间链路中,我们基于 vLLM 的原型比目标端恢复方法将平均 SIT 降低了 $2.28$--$89.68$,与源端转发相比将平均 ITL 降低了 $16.0\%$-$50.0\%$。