论文

FlexEE:面向权重卸载推理的自推测与KV兼容提前退出

FlexEE: Self-Speculative and KV-Compatible Early Exiting for Offloading-Aware LLM Inference

模型推理推理加速

摘要

大模型推理常同时受计算和内存限制,尤其在自回归解码时跨内存层级传输权重的卸载部署中。减少执行层数既可降低每token延迟,也可避免昂贵权重移动。为此,我们提出资源受限和卸载推理的提前退出框架FlexEE。它通过逐层退出监督获得可靠中间层预测,利用Top-K局部词表上的自推测解码低成本决定退出,并用动态隐藏状态管理实现KV缓存正确且内存感知的执行。在生成及下游任务上,FlexEE以很小准确率损失实现高效提前退出。对Llama2-7B,0%和50%权重卸载时端到端最高加速分别1.27倍和3.16倍;对Llama3-8B,分别1.25倍和2.83倍。

FlexEE:面向权重卸载推理的自推测与KV兼容提前退出:论文配图
图2:FlexEE框架。对卸载层执行两阶段提前退出预测:先用自推测层缩小候选空间,再由提前退出层在缩小后的空间运行,设计依据三项统计观察。