论文

我们观察到的 LLM 行为可能是推理后端的副作用

What We Observe as LLM Behavior Can Be a Side-effect of Inference Backend

模型评测鲁棒性、公平性与可信度评测

摘要

基准分数被报告为模型的属性,但用于生成它们的推理框架(例如 HuggingFace、vLLM 或 Ollama)被认为没有影响力,并且它们的名称和版本几乎从未公开。在这项工作中,我们研究了这种选择对模型输出的影响有多大。在一项完全交叉的研究中(三个指令调整模型 x 五个推理框架 x 六个基准 x 四种生成模式),我们研究了不同工具(包装器/后端)如何影响基准分数以及它们的分数变化如何受到生成超参数的影响。我们发现后端是一个不可忽视的因素,即使在贪婪、无采样噪声解码的情况下,更改后端也可以显着改变模型性能,并且这种影响是结构性的并且强烈依赖于模型。根据生成模式分解方差表明,从业者看到的开箱即用的可变性的相当一部分(大约 39%)可能源于后端,而其余的则源于采样噪声和每个框架的默认生成参数,这两者都可以通过公开和匹配生成配置来避免。这些分歧在事实上比在社会偏见基准上更为明显。总的来说,基准测试数字与后端无关,因此,我们建议公开后端、其版本和完整的生成配置,并使用确定性解码进行跨后端比较。