论文

自适应深度稀疏框架:预训练 LLM 的相似性驱动资源分配

Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs

模型推理推理加速

摘要

大语言模型(LLM)实现了强大的生成和推理性能,但Transformer架构的推理成本很高。现有的加速方法通常依赖于特定于任务的 微调 或从头开始训练,增加了适应成本并限制了跨任务可用性。我们提出了一个自适应深度稀疏框架(AdaDSF),它将现成的预训练 LLM 转换为深度稀疏模型,而无需完全重新训练。我们的主要见解是,层对表示转换的贡献不均匀,其特征是层输入和输出隐藏状态之间的余弦相似性。在此基础上,AdaDSF 根据相似性统计数据分配分层标记保留率,使用轻量级路由器在每一层选择信息丰富的标记,并引入保留特征的对齐目标来匹配稀疏模型和密集模型之间的中间和最终表示。在 GPT-NeoX 和 Qwen2.5 上的语言建模和常识推理上,AdaDSF 大大减少了推理 FLOP,同时保持接近密集对应物的性能。在相当的稀疏度下,AdaDSF 始终比强基线(包括 MoD、D-LLM 和 DLO)产生更小的精度下降。