论文
资源自适应的端到端动态稀疏性 LLM 推理
End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference
摘要
大语言模型 (LLM) 推理通常在静态资源假设下部署,其中模型执行固定的计算图,无论运行时环境如何。然而,现实世界的云基础设施本质上是动态的,其特点是可用性波动(例如,现货实例抢占)和分层的服务质量要求。在这种不稳定的环境中,静态模型不灵活:它们要么在资源限制下崩溃,要么在冗余操作上浪费计算。为了弥补这一差距,我们提出了学习分配(L2A),这是一种用于资源自适应推理的端到端框架。与仅以输入难度为条件的先前方法不同,我们将推理制定为以输入和运行时资源预算本身为条件的约束分配问题。我们引入了集成到 LLM 中的轻量级、预算调节和输入感知的门控网络。这些门通过统一的目标进行训练,该目标沿着三个轴共同优化任务性能、逻辑一致性和资源成本,以匹配现实世界的动态表现:针对内存和深度压力的层跳跃、针对吞吐量争用的头部修剪以及针对延迟收紧的推理词元减少。这让模型能够学习超越输入难度的预算感知策略:它根据实时资源动态自适应地配置其计算足迹,在资源允许时最大化推理深度,同时在预算紧张时强制执行严格节俭。单个 L2A 模型跟踪 Llama-3-8B 和 Qwen-3-4B 上的整个计算精度 Pareto 前沿:在高达 34% 的实现层稀疏度下,它保持在 GSM8K 上密集基线的 0.6% 以内,在分布外任务上保持零样本的差距相同,而每个静态或启发式基线都需要单独调整的模型,并且在可比较的推理下仍然下降 5-10%时间。