论文
无需训练放松型推测解码的实际研究
A Practical Investigation of Training-free Relaxed Speculative Decoding
摘要
推测解码 通过使用更快的辅助模型来起草词元,然后由 LLM 并行验证,从而加速自回归 LLM 的采样。标准 推测解码 是无损的:其拒绝和重采样步骤准确地保留了 LLM 的采样分布。最近的研究表明,放松这种严格的保证可以带来进一步的加速、受控的能力-速度权衡,甚至能力增益。我们实际研究 无需训练 宽松的 推测解码 技术,在共享框架内统一现有方法,在当代环境中进行基准测试,并为从业者提炼要点和实证结果。重要的要点包括:与无损 推测解码 不同,放松可能需要大量的能力评估,并且许多放松的方法依赖于良好语言模型的起草者,这使得它们不适合轻量级的专用多词元预测起草者。