论文
FlexEE:面向权重卸载推理的自推测与KV兼容提前退出
FlexEE: Self-Speculative and KV-Compatible Early Exiting for Offloading-Aware LLM Inference
摘要
大模型推理常同时受计算和内存限制,尤其在自回归解码时跨内存层级传输权重的卸载部署中。减少执行层数既可降低每token延迟,也可避免昂贵权重移动。为此,我们提出资源受限和卸载推理的提前退出框架FlexEE。它通过逐层退出监督获得可靠中间层预测,利用Top-K局部词表上的自推测解码低成本决定退出,并用动态隐藏状态管理实现KV缓存正确且内存感知的执行。在生成及下游任务上,FlexEE以很小准确率损失实现高效提前退出。对Llama2-7B,0%和50%权重卸载时端到端最高加速分别1.27倍和3.16倍;对Llama3-8B,分别1.25倍和2.83倍。
