论文
APEX:按请求与反馈选择推测解码策略
APEX: Speculate smarter, not deeper
摘要
推测性解码通过在目标模型验证之前起草多个 token 来减少大语言模型推理延迟,但其有效性取决于提议机制和草案深度。固定配置无法响应生成过程中可预测性、重复性和接受度的变化,因此更深的绘图可能会增加浪费的计算,而不会按比例加速。我们引入了 APEX,这是一种学习控制器,它通过请求级专家选择和块级深度自适应来平衡解码速度和草稿 token 浪费。 APEX-Router 针对每个请求在 EAGLE-3、n-gram 和草稿模型推测中进行选择,而 APEX-Depth 使用因果解码信号和最近的验证者反馈来调整每个验证块的草稿长度。 APEX 模型接受草稿长度作为审查的生存反馈、学习位置明智的拒绝风险、块执行成本以及平衡吞吐量、接受的进度和浪费的 token 的动作实用程序。这允许控制器适应推测,同时保留目标模型的验证过程。我们将 APEX 集成到 vLLM 中,并使用 Qwen3-8B 在六个工作负载中对其进行评估,与自回归解码相比实现了高达 5.24 倍的加速。在总体评估中,APEX-S 实现了 4.27 倍的加速,而 APEX-B 实现了 3.27 倍的加速,与 k=16 处的固定 n 元分析相比,浪费的 token 百分比相对减少了 41.0%,为平衡加速和草案 token 利用率提供了不同的操作点。
