论文

SpecKV:具有压缩感知伽玛选择的自适应 推测解码

SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection

模型推理投机采样

摘要

推测解码 通过使用小型草稿模型提出由较大目标模型验证的候选标记来加速 大语言模型 (LLM) 推理。此过程中的一个关键超参数是推测长度 $γ$,它决定草稿模型每一步提出多少个词元。几乎所有现有系统都使用固定的 $γ$(通常为 4),但经验证据表明最佳值因任务类型而异,并且最重要的是取决于应用于目标模型的压缩级别。在本文中,我们提出了 SpecKV,一种轻量级自适应控制器,它使用从草稿模型本身提取的信号来选择每个推测步骤 $γ$。我们对 推测解码 进行了 4 个任务类别、4 个推测长度和 3 个压缩级别(FP16、INT8、NF4)的分析,收集了 5,112 个步骤级记录以及每步接受率、草稿熵和草稿置信度。我们证明了最佳 $γ$ 在压缩机制中发生变化,并且草稿模型置信度和熵是接受率的有力预测因子(相关性 $\approx$ 0.56)。 SpecKV 使用在这些信号上训练的小型 MLP 来最大化每个推测步骤的预期标记,与固定 $γ=4$ 基线相比实现了 56.0% 的改进,每个决策仅需 0.34 毫秒的开销(<步骤时间的 0.5%)。该改进具有统计显着性(p < 0.001,配对引导测试)。我们将所有分析数据、经过训练的模型和笔记本作为开源工件发布。