论文

SpecBound:具有分层置信度校准的自适应有界自我推测

SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration

模型推理投机采样

摘要

推测解码 已成为加速 大语言模型 (LLM) 中自回归推理的有前途的方法。自起草方法利用基础 LLM 本身进行推测,避免了辅助草案模型的开销,但面临局限性:浅层通常会产生过度自信但不正确的词元预测,并且草案序列中困难词元的存在迫使通过更深层进行冗余计算,从而破坏草案接受和整体加速。为了解决这些问题,我们提出了一种新颖的自拟框架,该框架通过提前退出决策中的分层温度退火来抑制虚假置信度,并根据词元解码难度自适应地限制推测长度。通过在深层的统一并行传递中重新处理草稿标记的隐藏状态,我们的方法保持了与原始模型的精确输出等价性,同时最大化了计算效率。它不需要对基本 LLM 参数进行修改,并且在不同的长格式生成任务和多个模型架构中实现了比标准自回归解码高达 2.33 倍的墙时间加速。