论文

LayerRoute:具有 LoRA 保留质量的自适应跳层,可实现高效的 LLM 推理

LayerRoute: Adaptive Layer-Skipping with LoRA-Preserved Quality for Efficient LLM Inference

模型架构Transformer

摘要

我们引入了 LayerRoute,一种用于自适应Transformer跳层的参数高效方法,它将每层硬门控路由(通过直通估计器训练)与联合 LoRA 微调相结合。 LayerRoute 使用轻量级每层路由器(约 21.5K 参数)和 LoRA 适配器(排名 8,约 1.08M 参数)增强了 Qwen2.5-0.5B-Instruct 中的 24 个Transformer块中的每一个,并在门正则化语言建模目标下联合训练。在 10 次独立种子训练运行中,LayerRoute 在每次运行中都会收敛到相同的跳过模式结构 - 一组一致的 9 个中间层 (8-16) 在所有 10 个种子中都符合跳过资格 - 并在每次运行中提供真正的、经过验证的挂钟加速(1.02x-1.06x,平均 1.04x)。在测试的每个配置中,质量都得到了保留或提高:联合 LoRA 适应在所有 10 个种子中比未修改的主干产生了困惑度改进(使用的两个评估分割的平均增量 = -1.16 和 -1.11)。我们进一步验证路由器执行真正的、不平凡的每输入计算:跳过合格层中的门决策改变了 87-100% 保留样本的实际跳过/运行结果,确认了真正的依赖于输入的路由而不是固定的修剪模式。 LayerRoute 在单个 A100 上的训练时间不到 7 分钟,除了路由决策本身之外,增加的开销可以忽略不计。作为这项工作的一部分,我们报告了完整的可重复性方法,包括对决定路由器每个输入决策的因素进行系统诊断调查。