论文

Stream2LLM:重叠上下文流和预填充以缩短首次词元时间 (TTFT)

Stream2LLM: Overlap Context Streaming and Prefill for Reduced Time-to-First-Token (TTFT)

AI 基础设施推理服务

摘要

用于 LLM 推理的上下文检索系统面临着严峻的挑战:高检索延迟会在等待完整上下文(首次词元时间短)和没有上下文继续进行(质量下降)之间产生根本性的紧张关系。增量地流式传输上下文(将检索与推理重叠)可以减轻这种延迟,但对于并发请求这样做会带来新的挑战:请求争夺 GPU 计算和内存,并且调度必须适应动态上下文的到达。我们推出了 Stream2LLM,这是一种流感知 LLM 服务系统,用于并发预填充解码分解部署。 Stream2LLM 为两种不同的检索模式引入了自适应调度和抢占:追加模式(渐进式上下文累积)和更新模式(具有缓存失效的迭代细化)。它将调度决策与资源获取分离,从而实现由特定于硬件的成本模型指导的灵活抢占策略,并使用最长公共前缀匹配来最大限度地减少输入动态变化时的冗余计算。为了评估 Stream2LLM,我们收集了两个基于网络爬行和近似最近邻搜索的大规模真实流工作负载。我们的评估表明,流式架构可实现高达 11 倍的 TTFT 改进,成本感知调度可在内存压力下提供关键优势,同时保持与非流式基准的吞吐量相同。代码:https://github.com/rajveerb/stream2llm/tree/mlsys_artifact