论文

大语言模型 中激活稀疏化的灵敏度感知阈值和词元路由

Sensitivity-Aware Thresholding and Token Routing for Activation Sparsification in Large Language Models

模型优化稀疏化

摘要

大语言模型 (LLM) 中的高效推理需要决定在保持模型质量的同时可以减少哪些计算量。我们通过多层感知器(MLP)激活稀疏化和 词元级 条件路由来研究这个问题。我们首先提出稀疏灵敏度感知阈值(SATS),这是一种阈值校准方法,使用本地 MLP 输出灵敏度代理来选择分层门阈值,而不是直接从激活百分位数校准阈值。虽然 SATS 保留了通过对门激活进行阈值化来稀疏 MLP 激活的现有机制,但它用敏感度感知选择规则取代了基于百分位的校准。然后,我们引入一个轻量级词元路由框架,该框架根据每个词元在基本路径和修改路径之间进行动态选择,而不是将修改后的计算统一应用于所有词元。我们在多个最近的开放权重 LLM 上评估这两种方法。我们的结果表明,SATS 在匹配实际稀疏度时比基于阈值的稀疏化基线有所改进,并且词元路由比静态激活修改基线产生更有利的质量吞吐量权衡。总的来说,我们的结果表明,改进的阈值校准和词元路由可​​以改善 LLM 中的质量吞吐量权衡。