对周期性步骤层跳跃进行严格匹配的审计,以实现高效的 LLM 推理:conflayers 与 swift,并对经过训练的路由替代方案进行补充分析
A rigor-matched audit of periodic-step layer skipping for efficient llm inference: conflayers versus swift, with a supplemental analysis of trained routing alternatives
摘要
用于高效 LLM 推理的跳层方法在一定粒度上决定针对给定输入执行哪个 Transformer 层。我们提出了对两种周期步骤、基于搜索的方法的严格匹配的三种子审核,这些方法在推理时在线做出此决策,并每隔几代步骤重新评估它:置信门控提前退出基线 (ConfLayers) 和真正的自我 推测解码 (SWIFT, Xia 等人,2024),以及普通自回归解码,跨越 Qwen2.5-0.5B 和Qwen2.5-1.5B(Yang 等人,2024 年)在 GSM8K(Cobbe 等人,2021 年)和 CNN/DailyMail(Nallapati 等人,2016 年;参见等人,2017 年)上。 SWIFT 在四分之三的小区中准确性最强,而 ConfLayers 在所有地方都占主导地位,在 GSM8K 上的 1.5B 缺陷尤其严重。将在线搜索开销与纯粹推理成本分开,我们发现 SWIFT 的真实推理速度在所有四个单元中都比 ConfLayers 更快 (5-21%),扭转了三个单元中简单的挂钟排名; ConfLayers 的搜索开销较小且稳定(成本的 1-2%),而 SWIFT 的搜索开销较大且跨种子的变化更大(高达 28.7%)。我们还检查了两种经过训练的路由方法,LayerRoute(Sikdar,2026)(一种按序列、输入条件的硬门)和 LayerDrop(Fan 等人,2020)(一种固定的、与输入无关的修剪模式),作为补充分析而不是头对头比较,因为两者都以较粗的决策粒度运行。在具有真正的每输入门控、真正的全模型基线和真正的推理时间计算跳跃的经过验证的协议下,两者都显示出适度的实际加速(1.08-1.33x),但精度远低于周期步骤方法,包括 GSM8K 上 1.5B 时几乎完全的 LayerRoute 崩溃(三个种子之间的精确匹配平均值为 0.003)。我们发布完整的审核协议作为严格匹配的效率比较的模板。