论文
压缩前先诊断:LLM服务轨迹中不依赖预测的瓶颈证据细化
Diagnose Before You Compress: Prediction-Independent Bottleneck Witness Refinement for LLM Serving Traces
摘要
生产中的LLM服务生成数百万个不同的请求,使得服务配置之间的全量回放变得越来越昂贵。现有的回放方法主要保留工作负载分布或代表性请求,但瓶颈揭示的工作负载可能罕见且非代表性。此外,证据不足的组件无法补偿证据缺失的组件,而使用预测的瓶颈作为目标真理会导致循环评估。这些限制性使得每种瓶颈组件都需要保留证据,而不是依赖工作负载的代表性。我们提出Bottleneck-Preserving Witnessing(BPW),这是一种紧凑且诊断可靠的LLM服务回放套件的质量约束框架。BPW首先使用响应盲的工作负载特征和闭源侧测量来命名工作负载候选。这一阶段识别可能暴露调度器、预填充、解码或KV缓存瓶颈的工作负载。Coverage-Priority Sequence Construction然后将多组件提案组织成可重用的超边,并优先级化弱和未覆盖的维度。最后,Bottleneck Truth Verification从直接的目标系统测量中推导出预测无关的标签。验证结果确定每种组件的最早前缀,满足直接两个证据要求。在BurstGPT、ServeGen和Mooncake上的实验表明,BPW以紧凑的工作负载集达到验证门,并优于16个策略,分别在Mean prefix Macro-F1和WBRC-AUC上实现了2.3%和16.3%的相对改进。阶段解析和敏感性分析证实了其三个阶段的显著贡献和局部稳定性。我们的代码可在https://github.com/llmllmllm/BPW处公开获取。