论文
WhiFlash:使用 词元级 跨范式路由加速 推测解码
WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing
摘要
大语言模型 (LLM) 的自回归性质仍然是推理的一个重要瓶颈,特别是在复杂的代理工作负载中。虽然 推测解码 (SD) 加速推理,但当前的方法依赖于静态绘图范例,利用自回归绘图模型进行推理,或利用基于扩散的并行绘图模型进行结构化输出。我们凭经验发现,绘图精度在单个序列内波动很大,导致静态范式和粗粒度路由无法实现显着的性能。为了解决这种波动性,我们引入了 WhiFlash,这是第一个跨范式 SD 方法,它将自回归和基于扩散的并行绘图统一在单个 词元级 控制器下。 WhiFlash 采用细粒度路由机制,该机制采用轻量级基于熵的策略或学习的神经策略,两者均经过参数化以在预期词元增益和延迟之间提供可调平衡。为了使高频切换在计算上可行,我们引入了新颖的缓存管理优化、延迟追赶和仅 KV 预填充,将切换开销降低到每轮延迟的 7% 以下。通过利用根本不同的绘图架构的互补优势,WhiFlash 实现了显着更高的接受长度,与最先进的自回归 EAGLE-3 相比,特定类别的吞吐量增益高达 69.6%,比基于扩散的 DFlash 高达 37.3%。