论文

静默超参数:量化推理后端对 LLM 再现性的影响

The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

模型评测鲁棒性、公平性与可信度评测

摘要

LLM 的进展越来越多地通过标准化基准来衡量,其中最先进的改进通常相差几个百分点。与此同时,评估现代 LLM 的计算成本推动了专业推理后端、在推理时有效执行训练模型的软件系统的广泛采用。虽然对于可扩展性至关重要,但系统级优化(例如自定义 CUDA 内核和降低精度的算术)可能会改变词元概率并引入不确定性,可能会级联到发散生成中。在这项工作中,我们首先调查了推理环境,识别了 200 个不同的引擎,并分析了 35,000 份 ML 出版物,发现尽管存在广泛的多样性,但特定的推理堆栈却很少被报道。然后,我们对推理后端如何影响 LLM 基准测试结果进行系统的实证研究。在保持模型权重、解码参数和硬件不变的情况下,我们在多个开放权重模型和既定基准中评估了五种广泛使用的推理引擎,包括 vLLM、SGLang 和 llama$.$cpp。我们表明,仅选择后端就可以将基准分数改变高达 16.6 个百分点,并导致输出不一致率很高。通过隔离后端优化和跟踪执行管道,我们发现这种差异是由系统级优化驱动的,例如前缀缓存和 CUDA 图、自定义内核以及 logits 处理中特定于引擎的默认值。我们的研究结果将推理后端确定为 LLM 评估中先前未报告但重要的超参数,并提倡标准化推理堆栈报告,以提高基准比较的可重复性和可解释性。