论文

通过混合分析机器学习预测器对 大语言模型 推理延迟和能量进行多级建模

Multi-Level Modeling of Large Language Model Inference Latency and Energy via Hybrid Analytical--Machine-Learning Predictors

模型评测评测方法与指标

摘要

大语言模型 (LLM) 的快速扩展显着增加了计算成本、能耗和推理延迟,使得准确的估计对于可持续的人工智能部署和硬件感知设计至关重要。在这项工作中,我们介绍了 LLM (HYMELL) 的能量和延迟混合建模,这是一种混合三级框架,用于通过将分析建模与机器学习 (ML) 相结合来估计 LLM 推理延迟和能量。 HYMELL 通过三级层次结构对 LLM 执行进行建模:原始操作的分析估计、更高级别组件的 ML 预测以及捕获预填充和解码阶段的系统级开销的端到端模型。该框架支持多种架构,包括密集和专家混合 (MoE) 前馈网络 (FFN),以及多头注意力 (MHA) 和分组查询注意力 (GQA) 机制。在 NVIDIA H100 图形处理单元 (GPU) 上进行评估,HYMELL 实现了很高的预测精度;值得注意的是,对于 LLaMA 3 8B,预填充和解码阶段的错误率均低于 5%。通过直接根据架构参数预测执行成本,它可以实现快速、无硬件的设计空间探索和节能优化。