论文

River-LLM:基于KV共享的大语言模型无缝退出

River-LLM: Large Language Model Seamless Exit Based on KV Share

模型推理推理加速

摘要

大语言模型 (LLM) 在不同领域展现了卓越的性能,但越来越受到高推理延迟的限制。 Early Exit 已成为一种有前景的解决方案,可通过动态绕过冗余层来加速推理。然而,在仅解码器架构中,早期退出的效率受到 KV 缓存缺失问题的严重瓶颈,其中跳过的层无法为后续词元提供必要的历史状态。现有的解决方案(例如重新计算或屏蔽)要么会带来显着的延迟开销,要么会导致严重的精度损失,无法弥合理论层数减少和实际挂钟加速之间的差距。在本文中,我们提出了 River-LLM,这是一个 无需训练 框架,可实现无缝 词元级 提前退出。 River-LLM引入了轻量级的KV共享退出River,允许主干丢失的KV缓存在退出过程中自然生成和保留,从而无需昂贵的恢复操作。此外,我们利用解码器块内的状态转换相似性来预测累积 KV 错误并指导精确的退出决策。对数学推理和代码生成任务的大量实验表明,River-LLM 在保持高生成质量的同时实现了 1.53 至 2.16 倍的实际加速。