论文
SPADE:面向精确低成本边云分布式推理的推测解码
SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference
摘要
大语言模型(LLM)在自然语言理解与生成方面取得显著成功,但其部署受高计算需求制约。直接在边缘部署较小LLM可以绕开这一问题,但精度会下降。部署基于云端的大LLM能保持性能,但代价是昂贵的按token计算。我们提出分布式推理框架SPADE,将推测解码(SD)集成到边云两端。部署在边缘的紧凑草稿模型快速生成候选token,云端的大型验证器模型并行验证这些token。被接受的token被保留,仅拒绝时才触发验证器纠正,从而大幅减少云端查询次数。我们的即插即用设计将大部分计算转移到边缘,显著降低推理时间与云成本,并且无需任何再训练即可保持大模型的精度。我们的方法展示了在真实环境中可扩展、低成本且精确部署LLM的实用路径。在使用SpecBench与CNN/Dailymail数据集的多个自然语言处理任务上的实验结果表明,与完整模型相比,SPADE将云端模型调用减少76%,且精度零损失。
