论文
从词元到步骤:用于高效多步骤推理的验证感知 推测解码
From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning
摘要
推测解码 (SD) 通过允许轻量级草稿模型提出由更强大的目标模型验证的输出来加速 大语言模型 推理。然而,其以词元为中心的性质允许错误步骤传播。先前的方法使用外部奖励模型来缓解这种情况,但会产生额外的延迟、计算开销并限制通用性。我们提出了 SpecGuard,这是一种验证感知 推测解码 框架,仅使用模型内部信号执行步骤级验证。在每一步中,SpecGuard 对多个候选草案进行采样,并选择最一致的步骤,然后使用两个轻量级模型内部信号的集合进行验证:(i) 基于注意力的基础分数,用于衡量输入和先前接受的步骤的归因;(ii) 基于对数概率的分数,用于捕获 词元级 置信度。这些信号共同确定是否接受或使用目标重新计算某个步骤,从而有选择地分配计算。一系列推理基准测试表明,SpecGuard 将准确性提高了 3.6%,同时将延迟降低了约 11%,优于 SD 和奖励引导的 SD。