论文

杠杆:智能手机上的推测性 LLM 推理

Lever: Speculative LLM Inference on Smartphones

模型推理投机采样

摘要

交互式移动应用程序越来越需要 大语言模型 (LLM),但高质量模型超出了智能手机上可用的有限 DRAM。闪存存储可以容纳更大的模型,但闪存支持的推理速度很慢,因为自回归解码会重复调用目标模型并产生昂贵的 I/O。我们观察到 推测解码 非常适合此设置:小型草稿模型可以保留在 DRAM 中,而较大的闪存驻留目标模型每次调用都会验证多个候选词元。然而,现有方法假设服务器级加速器,无法解决延长的 I/O 延迟、有限的计算并行性和不规则的推测执行。我们推出了 Lever,这是一种端到端系统,用于在智能手机上进行高效的闪存支持 LLM 推理。 Lever 在移动限制下联合优化了 推测解码 的三个阶段。对于起草,它使用 I/O 和计算感知的增益成本目标构建词元树。为了进行验证,它通过提前退出预测来修剪低值分支,以减少目标模型计算。在执行方面,它可以在移动 CPU-NPU 硬件之间有效地映射推测,以提高利用率。综合评估表明,Lever 的推理延迟比基准闪存卸载推理平均减少了 2.93 倍,比传统 推测解码 平均减少了 1.50 倍,缩小了闪存支持和内存驻留 LLM 推理之间的延迟差距。