论文

解码延迟反馈预填充:无模型控制器及其泛化限制

Decode-Latency Feedback Prefill: A Model-Free Controller and Its Generalization Limits

AI 基础设施推理服务

摘要

并发自回归推理会产生一个根本性的干扰问题:预填充新到达的长提示可能会延迟已解码请求的词元。固定预填充块可以减少这种干扰,但最佳块大小取决于模型、硬件、负载和延迟目标。我们引入了解码延迟反馈预填充 (DLFP),这是一种无模型控制器,仅更改与活动解码重叠的预填充工作。在一个受保护的调度周期之后,DLFP 使用观察到的间隔作为比例反馈来调整下一个预填充块的大小;隔离预填充仍然不受限制。我们在 vLLM 中实现 DLFP,并使用开环泊松到达、精确词元计算、原始请求跟踪和 NVIDIA 遥测对其进行评估。在 BF16 中的 Qwen3-0.6B 上,在一个 A100 80 GB GPU 上,三对 100 个请求试验将 P99 词元间延迟减少了 24.8%、30.1% 和 28.2%(平均值 27.7%,配对 95% 置信区间 21.0% 到 34.3%),输出一致,无故障,SLO 合规性保持不变。好处不是免费的:平均 P99 首次词元时间增加了 34.8%,同时保持在声明的 SLO 范围内。至关重要的是,该机制不能推广到 Qwen3-8B、Qwen3-32B 或双 GPU 张量并行配置。我们将故障追溯到异步调度程序调用间隔,该间隔仅代表已完成的 GPU 迭代时间。这个负面结果定义了贡献的边界,并激励完成定时控制器进行并发 CPU 和设备上推理。我们不主张移动设备的性能;目前的工作是一项可重复的概念验证和概括研究。