论文
AdaFuse:通过词元级预门控与融合内核优化加速动态适配器推理
AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization
摘要
将专家混合(MoE)等动态稀疏结构与参数高效适配器(如LoRA)相结合,是增强大语言模型(LLM)的一种强大技术。然而,这种架构增强代价高昂:尽管计算负载增幅很小,推理延迟却常常飙升,导致解码速度放慢超过2.5倍。通过细粒度的性能分析,我们将主要瓶颈定位于并非计算本身,而是传统动态路由所需的碎片化、串行CUDA内核启动带来的严重开销。为应对这一挑战,我们提出AdaFuse,一个建立在算法与底层硬件系统紧密协同设计之上、支持高效动态适配器执行的框架。有别于传统的逐层或逐块路由,AdaFuse采用词元级预门控策略,在词元被处理之前针对所有适配器层做出一次全局路由决策。这种“一次决策、处处应用”的方法有效地将每个词元的执行路径静态化,为整体优化创造了机会。我们借此开发了执行融合切换操作的自定义CUDA内核,可在单次高效处理中将所有被选中的LoRA适配器参数合并进主干模型。在主流开源LLM上的实验结果表明,AdaFuse在取得与最先进动态适配器相当的准确率的同时,将解码延迟大幅削减超过2.4倍,从而弥合了模型能力与推理效率之间的差距。
