论文
SpecQuant:利用多父量化进行推测解码,以实现自适应 LLM 推理
SpecQuant: Speculative Decoding with Multi-Parent Quantization for Adaptive LLM Inference
摘要
在本地运行大型语言模型 (LLM) 仍然受到消费者硬件上的计算和内存的限制。流行的加速技术,例如量化、推测解码和自适应推理,可以显着提高速度,但通常需要重新训练、按架构调整或草拟模型。 SpecQuant 是一个免训练框架,它将推测解码与多父量化相结合,以执行 LLM 的自适应、高效推理。 SpecQuant 从共享基础模型中派生出多个量化变体(INT4、FP8、FP16),并根据预测的复杂性动态路由查询;轻量级变体用于简单或事实任务,全精度模型用于复杂推理任务或长上下文输入。 SpecQuant 的共享权重设计可确保推测解码有足够的词元接受度,而不会使用单独的草稿父模型出现兼容性问题。我们在 MMLU、AlpacaEval 和 GSM8K 数据集或基准上对基于 Qwen2.5 的模型进行 SpecQuant 评估,结果显示 35-43% 的加速速度不会降低超过 2%,这在大语言模型社区中是相当大的。 SpecQuant 可以在不同的硬件上实现实用的设备上 LLM 部署,无需特殊的基础设施或专业知识。