论文
无损但不免费:消费级硬件上投机解码的实证解剖
Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware
摘要
大语言模型的单流自回归解码受内存带宽约束:每个生成token都要对目标模型做一次完整前向,且相继的前向无法并行。投机解码重构了这一计算:小草稿模型自回归提出K个token,目标模型一次批量前向为它们全部打分,拒绝采样规则可证明地保持目标模型的输出分布。我们给出一个从零开始、设备无关(CUDA/MPS/CPU)的实现,并在消费级Apple芯片笔记本上对五种草稿/目标后端配置做实证研究。分布等价性在三个层级上验证,最终以每种方法约9,200个真实模型token的双样本检验收尾(χ²=162.5,自由度200,p=0.976),并达到精确的贪婪序列一致。最佳配置在K=6时实测1.61倍墙钟加速,接受率曲线从K=1的69.7%降至最优点37.8%;而五种配置中的三种反而减速——或因草稿跑不赢小目标模型,或因量化的Metal后端把“并行”验证串行执行,我们分离并量化了这一效应。失败与成功同样有启发性:投机解码只在验证真正批量并行、且草稿/目标延迟差真实存在时才有收益。