论文
具有自适应窗口的 推测解码 的性能驱动策略优化
Performance-Driven Policy Optimization for Speculative Decoding with Adaptive Windowing
摘要
推测解码 通过让轻量级草稿模型提出候选标记的推测窗口以通过更大的目标模型进行并行验证来加速 LLM 推理。在实践中,投机效率常常受到难以起草位置的瓶颈,其中早期的不匹配会截断已接受的前缀并使投机窗口的其余部分无效。大多数基于学习的绘图员仍然使用 词元级 监督目标进行优化,尽管推测效用本质上是窗口级和前缀敏感的。我们提出了 PPOW(自适应窗口的性能驱动策略优化),这是一种强化学习框架,可将绘图器优化从 词元级 模仿转变为窗口级优化。 PPOW 结合了成本感知加速奖励、基于分布的邻近奖励和自适应发散感知窗口,优先考虑具有高置信度加权草案目标发散的信息窗口。 PPOW 在统一解码协议下的多个模型系列和基准测试中实现了 6.29-6.52 的平均接受长度和 3.39-4.36$\times$ 的加速。这些结果表明,性能驱动的窗口级优化是提高 推测解码 效率的实用方法。