论文
LeanStream:用于高效设备上 LLM 推理的推测和优化流框架
LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference
摘要
设备上的 LLM 推理对于隐私和响应能力很有吸引力,但在移动和嵌入式设备上仍然具有挑战性,因为模型权重远远超过可用的 DRAM。先前的系统利用激活稀疏性并将权重卸载到 SSD 或闪存,但面临着一个基本的系统权衡:准确的稀疏执行决策需要最新的上下文,而高效的计算 I/O 重叠需要早期预测。因此,现有设计要么串行执行,要么导致冗余权重获取、额外计算和大量缓存开销。我们推出了 LeanStream,这是一种用于高效设备上 LLM 推理的流式推测和优化框架。 LeanStream 使用部分 GPU 结果逐步细化计算、加载和缓存保留优先级,从而实现 GPU 执行和存储 I/O 之间的细粒度重叠。我们在移动和嵌入式平台上实施 LeanStream。与之前的设备上 LLM 推理系统相比,LeanStream 在先前工作实现的最佳吞吐量下将内存使用量减少了 4.8$\times$ 至 7.5$\times$,同时进一步将词元生成吞吐量提高了 1.6$\times$ 至 2.1$\times$。