论文
具有强化学习功能的 LLM 体验驱动的动态退出
Experience-Driven Dynamic Exits for LLMs with Reinforcement Learning
摘要
大语言模型 遭受缓慢的自回归推理。虽然 self-推测解码 加速了这一过程,但其效率受到固定退出层和推测长度等静态配置的阻碍。我们将这种优化重新定义为 \textbf{Markov Decision Process} 并提出 \textbf{LEDE},这是一个使用离线强化学习的框架。 LEDE 学习一种策略,根据每一步生成序列的本地上下文动态选择最佳退出层和推测长度,平衡计算成本和草稿质量。对 Llama-2 和 Llama-3 模型的综合评估表明,LEDE 比自回归解码实现了高达 $2.0\times$$\sim$$2.7\times$ 的加速,并比静态推测基线额外提供了 17\% 的加速。