论文

VALSE:面向高效 LLM 推理的非连续自适应跳层

VALSE: Vertical Adaptive Layer Skipping for Efficient Inference in Large Language Models

模型推理推理加速

摘要

本文建立了垂直自适应层跳跃的理论框架,证明了三个基本结果:(i)预期 FLOPs 公式(定理 2)给出了任意每样本跳跃调度的计算成本与逐层跳跃概率的函数的封闭式表达式; (ii) 函数空间超集(定理 10)和严格包含(定理 11)定理表明,跳层模型严格包含在(但有意义地近似)全层函数空间中,并具有明确的分离示例; (iii) VALSE 和混合专家架构之间的结构对偶性(命题 6),将垂直深度稀疏性定位为水平宽度稀疏性的正交对应物。基于这一理论,我们提出了 VALSE(垂直自适应层跳过效率),一种按样本、非连续层跳过方法:轻量级难度估计器对前几层的每个输入进行评分,每层门选择性地跳过冗余层(包括任意中间层,同时保留更深的层),以便只为每个输入激活必要的深度,其可行性在原型规模上进行了初步评估。