论文

AngelSpec:利用 推测解码 实现现实世界的高性能推理

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

模型推理投机采样

摘要

推测解码 可以在不更改目标分布的情况下加速 大语言模型 推理,但没有单一的起草结构能够在实际工作负载中表现最佳。自回归多词元预测(MTP)是一种轻量级、稳定的提议机制,而块并行扩散可以在更长的候选序列上摊销起草延迟;更好的选择很大程度上取决于输出分布。我们提出了 AngelSpec,这是一个针对 MTP 的统一训练框架和块并行 推测解码,它在三个层面上解决了这种异构性。在训练层面,我们不是让一个通用起草者适应统一的数据混合物,而是共同专业化结构和数据:MTP 起草者接受针对高熵开放式聊天的不同对话数据的训练,块扩散起草者针对代码和数学数据进行训练,以获得更长的可预测延续。在架构层面,我们提出了 DFly,一种块扩散框架,将混合目标调节主干与前身条件自回归头相结合,提高目标特征利用率和块内依赖建模,同时保持生成并行。在推理层面,接受长度和验证成本都随着域、请求、在线负载和硬件的不同而变化,因此 DFly 将验证视为共享的批处理级资源:它跨请求向高置信度前缀重新分配计算,并将预期效用与分析成本模型相结合,以适应在线验证深度。在 Hy3 系列中,DFly 将 Hy3-A21B 上的平均接受长度提高了大约 30%,并在每次测试的并发数从 4 到 64 时获得了最高平均吞吐量,比自回归解码速度提高了 1.98-2.40 倍,吞吐量比 DFlash 高出 10.5-11.8%。我们发布了 AngelSpec 来支持训练和扩展这些方法。