论文
AdaptiveSD 具有稳定性感知、运行时自适应的 推测解码 框架,具有用于 CPU 受限的 LLM 推理的多策略编排
AdaptiveSD A Stability-Aware, Runtime-Adaptive Speculative Decoding Framework with Multi-Policy Orchestration for CPU-Constrained LLM Inference
摘要
随着基于 GGUF 的小型量化语言模型的兴起以及它们在设备上推理任务中的使用越来越多,我们看到越来越需要一种能够可靠地大规模交付这些模型的方法,即使在严格的内存带宽限制(例如纯 CPU 实现所施加的限制)下也是如此。固定深度 推测解码 已成为一种有前途的技术,但在实践中,它经常因带宽饱和、不稳定甚至灾难性资源耗尽导致系统故障而导致性能下降。为了克服这个问题,我们引入了 AdaptiveSD,这是一个完全运行时自适应的 推测解码 框架,旨在确保跨模型类型和工作负载的稳健、可靠的执行。我们的解决方案由四个在连续反馈循环中协同工作的紧密耦合组件组成:一个运行时监控引擎,用于跟踪与正在进行的计算相关的多个信号;一个自适应草稿控制器,用于执行十一条规则策略层次结构,优先考虑系统资源保留而不是原始草稿计数;一个动态策略引擎,采用一套启发式和强化学习技术,根据工作负载行为动态修改策略;最后,一个 KV 缓存协调层,通过 INT8 影子缓冲区和位置感知驱逐,通过细粒度控制来管理缓存状态。虽然传统方法只关注最大化吞吐量,但我们根据几个关键指标评估我们方法的有效性,包括浪费的起草计算和词元间延迟分散以及投机效率的标准衡量标准。