论文

识别并缓解生产级LLM推理基准中的系统性测量偏差

Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks

模型评测评测方法与指标

摘要

随着大语言模型(LLM)从研究环境走向生产部署,对照严格的服务级别目标(SLO)评估其性能变得至关重要。然而,当前的评估方法在大规模场景下存在严重的测量偏差。我们证明,广泛使用的基准测试工具依赖单进程、asyncio驱动的架构,会在高并发下引入根本性的客户端排队瓶颈。通过将基准测试客户端建模为 $M/G/1$ 队列,我们从数学上证明了随着请求速率提升,Python全局解释器锁(GIL)会人为夸大首Token时间(TTFT)和每输出Token时间(TPOT)指标。为解决这一系统性误差,我们提出一个无偏的多进程评估框架,能有效分散客户端负载,确保排队开销可忽略不计。此外,我们形式化了一个复合指标——归一化每输出Token时间(NTPOT),以稳健地摊销包括prefill和调度延迟在内的跨序列长度端到端延迟。我们的实证评估表明,该方法能成功分离出纯粹的推理引擎性能,从而在每秒超过数千次查询的生产规模下对LLM进行准确、可复现的性能剖析。

识别并缓解生产级LLM推理基准中的系统性测量偏差:论文配图
图 7:Inference Perf 中的多进程请求工作流程,展示了该架构如何通过使用主编排进程和 nn 个工作进程来均匀分配负载,从而克服单进程基准测试工具中的单事件循环和 CPU 耗尽问题