论文
注重细节:评估 vLLM 配置中的能源、性能和准确性权衡
Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations
摘要
大语言模型 正在重塑软件的开发和维护方式。它们通常使用 vLLM 等推理引擎部署在生产中,可以有效地为预先训练的、高度可配置的模型提供服务。虽然之前的工作主要集中在模型架构和硬件加速上,但推理引擎配置对能耗、性能和输出质量的影响仍然知之甚少。在本文中,我们对三个选定的 vLLM 配置选项进行了大规模受控研究:注意力内核类型、前缀缓存和分块预填充。我们在 5 个开放权重 LLM 和 5 个不同的推理任务中评估了这些配置的所有组合,总计 9,000次运行和 93,600次测量。我们分析能耗、延迟和准确性,并检查配置选项和任务之间的主要影响和交互影响。我们的结果表明,所研究的配置选项显着影响能量和性能,主要由注意力类型和前缀缓存驱动,而分块预填充在默认 vLLM 服务配置和评估工作负载下效果有限。这些效果高度依赖于模型和工作负载,并且没有一种配置是普遍最佳的。我们进一步表明,模型选择主导着全局权衡,而配置调整则提供了沿帕累托边界的局部改进。出乎意料的是,推理选项也会影响模型的准确性。