论文

面向异构边缘设备LLM快速筛选的可迁移时延预测

Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices

AI 基础设施模型部署

摘要

准确的时延预测对于把大语言模型(LLM)部署到异构边缘设备至关重要,因为推理时延受模型架构、提示行为、运行时后端、硬件利用率、动态电压频率调节(DVFS)以及热变化的影响。本文提出一个运行时感知的时延预测框架,用于面向部署的LLM选择。该框架将每个推理请求表示为硬件-运行时-模型-提示配置,把推理分为prefill与decode两个阶段,并通过门控预测模型自适应地融合静态描述符与动态硬件遥测数据。我们使用Pixel移动设备评估该框架,并在Jetson Nano、Orange Pi 5 Pro和RTX 3090级GPU平台上验证了性能剖析流程。在Pixel 8上,相比仅用静态特征的基线,完整预测器将总时延R方从0.953提升到0.960,将decode时延R方从0.957提升到0.973。在Pixel 8 Pro上,它将prefill时延R方从-1.383提升到0.966。在跨设备迁移方面,校准将Pixel 8 Pro到Pixel 8的总时延R方从-0.974提升到0.940,decode时延R方从-1.085提升到0.927。异构剖析进一步表明时延高度依赖设备与运行时:同一SmolLM2模型家族在Orange Pi 5 Pro上达到8.42 tokens/s,而在RTX 3090级GPU上达到64.38 tokens/s。这些结果表明,带轻量校准的运行时感知预测能够降低剖析成本,并支持跨异构边缘平台的时延感知LLM部署。

面向异构边缘设备LLM快速筛选的可迁移时延预测:论文配图
图 1. 整体系统框架。该系统从模型空间和部署配置开始,其中包括预训练模型、源设备、目标设备、运行时后端和平台设置。源设备执行被部署和分析,以收集设备配置文件、模型描述符、部署配置和运行时跟踪。这些输入由具有静态路径和动态路径的可传输延迟预测器处理。