论文

投机解码中跨认知领域的接受动态

Acceptance Dynamics Across Cognitive Domains in Speculative Decoding

模型评测模型行为与机制分析

摘要

投机解码(speculative decoding)可加速大语言模型(LLM)推理。它使用一个小型草稿模型提出未来词元树。随后更大的目标模型在单次批量前向传播中验证这些词元。尽管投机方法的研究日益增多,任务认知特性在多大程度上影响接受概率仍在很大程度上未被探索。我们呈现一项关于基于树的投机解码接受动态的实证研究。我们的研究覆盖四个成熟的NLP基准领域:代码生成、数学推理、逻辑推理和开放式聊天。为此,我们使用TinyLlama-1.1B作为草稿模型,以Llama-2-7B-Chat-GPTQ作为目标模型。基于从200个提示收集的99,768个投机节点,我们推导出各领域的接受率、期望接受长度、深度-接受曲线以及熵-接受相关性。我们发现,任务类型比树深更能预测接受情况。此外,只有聊天领域能稳定产生每步超过1.0个词元的期望接受长度。我们还表明,在所有领域中熵-接受相关性一致为负但较弱(rho在[-0.20, -0.15]区间内)。与直觉相反,聊天的熵最高,接受率却最高。我们将这种分歧归因于经过RLHF对齐的语体的词汇可预测性。这些发现对领域感知的投机预算和草稿模型选择策略具有直接启示。关键词——投机解码、大语言模型推理、树注意力、草稿模型、接受概率、LLM效率