技术实践
百度用分词并行流水线提高推理服务吞吐
概述
Decode 集群需稳定支持 1200 QPS 实时推理服务,但实际负载超过 600 QPS 时系统频繁出现请求异常中止(abort),日志显示 decode 阶段 token 生成间隔超过 30 秒导致客户端超时断开。监控显示单个 CPU 核心持续满载、其余核心利用率不足,提示任务分配不均。排查中 CPU 频率、内存带宽、网络吞吐均符合规格、未见硬件瓶颈,性能剖析火焰图锁定 v1_chat_generate_request 解码循环占用近 90% 的 CPU 执行时间,说明 tokenizer 线程成为推理系统瓶颈、请求堆积。 优化方案是在应用层引入线程池,把 tokenizer 任务拆分为并行流水线,并基于 QPS 波动动态调整线程数。结果:QPS 提升至 1200+,abort 率降至 0%,Decode 阶段 token 间隙恢复正常。文中以此说明 CPU 在关键路径成为瓶颈时会导致 GPU 算力无法发挥。