论文

LayerRoute:通过 LoRA 微调 用于代理语言模型的输入条件自适应层跳跃

LayerRoute: Input-Conditioned Adaptive Layer Skipping via LoRA Fine-Tuning for Agentic Language Models

模型推理推理加速

摘要

代理语言模型系统在两种结构上不同的步骤类型之间交替:结构化工具调用(短、确定性、低困惑度)和开放式规划/推理步骤(长、复杂、高困惑度)。尽管存在这种异构性,但当前的推理系统对每个步骤都应用相同的计算。我们引入了 LayerRoute,一个轻量级适配器,它学习根据每个输入有选择地跳过 Transformer 块。 LayerRoute 通过以下方式增强了 Qwen2.5-0.5B-Instruct 中的 24 个 Transformer 块中的每一个:(1) 通过直通估计器输出硬二进制门的每层路由器(~897 个参数,Linear(896,1)),以及 (2) Q/K/V/O 注意力投影上的 LoRA 适配器(秩 8,~1.08M 参数)。骨干权重保持冻结状态。使用门正则化项对代理数据(Hermes、Glaive、GSM8K、Turing)进行单个端到端训练会迫使系统发现每种输入类型可以跳过哪些块。经过 3,000 个步骤(A100 40GB 上为 6.4 分钟)后,LayerRoute 实现了 12.91% 的跳过差异:工具调用跳过了 15.25% 的 FLOP,而规划步骤仅跳过了 2.34%,仅使用 110M 可训练参数(494M 主干网的 0.22%)。由于 LoRA 适应,质量比基本模型有所提高,工具调用的困惑度增量为 -1.29,规划的困惑度增量为 -1.30。