论文

LLM 推理的二维提前退出优化

Two-dimensional early exit optimisation of LLM inference

模型推理推理加速

摘要

我们引入了一种二维(2D)早期退出策略,该策略协调 大语言模型 中分类任务的逐层和逐句退出。通过逐句增量地处理输入,同时逐步激活更深层次,我们的方法实现了乘法计算节省,超过了独立优化任一维度的计算节省。在三个情感分类数据集上对四个最先进的 LLM(Llama 3.1、Llama 3.2、Gemma、Qwen;3B-8B 参数)进行的实验评估表明,对于使用普通模型的更简单任务,与最佳逐层提前退出相比,速度提高了 1.4--2.3$\times$,并且对复杂的多类问题进行了优雅的降级。 微调 减少但并未消除这一优势。该方法与模型无关,仅需要轻量级分类适配器,并且与量化和修剪等补充效率方法正交。我们的研究结果表明,当语义信息在输入结构中可预测地积累时,2D 早期退出策略会表现出色,这表明它可能适用于情感分类之外的序列处理任务。