论文

推测性预先定位:将有状态会话解码到关键路径之外的下一个决策点

Speculative Pre-Positioning: Decoding Stateful Sessions to the Next Decision Point Off the Critical Path

AI 基础设施推理服务

摘要

无状态推理服务器(vLLM、SGLang、TensorRT-LLM)在加速器等待期间在请求之间空闲;有状态会话会回收空闲时间。推测性预定位使用目标模型自己的前向传递而不是草稿模型将会话向前解码到下一个决策点,从而将交叉请求预填充和条目解码移出关键路径:下一个请求从其增量上的预付费条目恢复,或者,当置信门触发时,从一次近乎恒定的词汇扫描中的缓存分布中得到应答,无需解码,仅消耗能量和罕见的有界错误接受。回报取决于能力:一个有能力的模型以接近完全覆盖和大约 87% 的精度触发门(较小的模型永远不会清除它),在大约 1.0 毫秒内返回第一个词元,而前缀缓存仍然需要 39 毫秒解码。