论文
PELM:具有 推测解码 和动态电压频率缩放的高能效设备上 LLM 推理
PELM: Power Efficient On-Device LLM Inference with Speculative Decoding and Dynamic Voltage Frequency Scaling
摘要
移动和边缘平台直接部署大语言模型可改善隐私、个性化与延迟,但计算需求难由受限资源满足。设备体积小,常缺少风扇等散热机制,高处理器占用会导致过热降频及算力下降。既有动态电压频率调整DVFS等功耗管理策略用于减少高负载计算的耗电与发热,也出现针对移动语言模型的方案,但多聚焦硬件参数和频率,在部分热约束情境下不足。基于并非所有词元都需完整深度推理才能保持生成质量的认识,PELM在DVFS频率调整外加入推测解码与可变验证深度两项工作负载控制,形成多维优化以改善端侧推理能效。多硬件平台与数据集实验中,相比先进功耗管理方法,速度最多提高23.1%、能耗最多减少52.4%,任务表现保持相近。代码:https://github.com/imec-nu/PELM。