论文
现代 LLM 中提前退出解码的收益递减
The Diminishing Returns of Early-Exit Decoding in Modern LLMs
摘要
在大语言模型(LLM)推理中,提前退出是指一旦预测足够置信就停止中间层的计算,从而减少延迟和成本。然而,最近的 LLM 采用了改进的预训练方法和架构,减少了层冗余,从而可能限制提前退出的机会。我们重新评估现代 LLM 中的逐层提前退出,并分析中间表示在训练过程中如何演变。我们引入了一个指标来量化模型对提前退出的内在适用性,并为研究人员提出了一个基准,以探索不同模型和工作负载的潜在提前退出优势。我们的结果显示,新一代车型的提前退出有效性呈递减趋势。我们进一步发现,密集的 Transformer 通常比专家混合模型和状态空间模型提供更大的提前退出潜力。此外,较大的模型,特别是那些参数超过 200 亿个的模型,以及未经专门调整的基本预训练模型往往表现出更高的提前退出潜力。