论文

ConfLayers:自适应基于置信度的自我跳层 推测解码

ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding

模型推理投机采样

摘要

Self-推测解码 是 大语言模型 的一种推理技术,旨在加速生成而不牺牲输出质量。它将使用模型的紧凑版本作为草稿模型的快速近似解码与完整目标模型的选择性重新评估相结合。一些现有的方法通过动态学习在推理过程中跳过哪些层来形成草稿模型,有效地创建更小的子网络以加速计算。然而,使用基于启发式的方法来选择要跳过的层通常会更简单、更有效。在本文中,我们提出了 ConfLayers,一种动态即插即用方法,通过基于置信度的中间层跳跃在 self-推测解码 中形成草稿模型。该过程迭代地计算所有层的置信度分数,根据自适应阈值选择要跳过的层,评估结果集的性能,并更新最佳选择,直到没有进一步的改进或达到最大迭代次数。该框架避免了训练跳层策略的开销和复杂性,并且可以提供更一致的速度质量权衡,同时保留草稿模型对不同任务和数据集的适应性。对不同模型和数据集的 ConfLayers 的性能评估表明,我们的新颖方法比普通 LLM 一代提供高达 1.4 倍的加速。