论文
大语言模型 的压缩感知引导、推理感知结构化缩减
Compressed-Sensing-Guided, Inference-Aware Structured Reduction for Large Language Models
摘要
大语言模型 提供强大的生成性能,但代价是大量参数计数、内存使用和解码延迟。先前的工作表明,修剪和结构化稀疏性可以在大量压缩下保持准确性,而即时压缩方法可以通过删除冗余输入词元来减少延迟。然而,这两个方向在很大程度上仍然是分开的。大多数模型压缩方法都是静态的并且离线优化,并且它们没有利用不同提示和解码步骤激活不同潜在计算路径的事实。即时压缩方法减少了序列长度,但它们不适应执行的模型子网络。我们提出了一个用于动态 LLM 执行的统一压缩感知引导框架。随机测量算子探测潜在模型的使用情况,稀疏恢复估计任务条件和词元自适应支持集,并将恢复的支持编译成块、注意力头、通道和前馈子结构上的硬件高效稀疏执行路径。该框架引入了五个关键贡献:任务条件测量,因此不同的提示会产生不同的稀疏支持;词元自适应恢复,因此在解码期间重新估计活动子结构;受限等距或相互不相干假设下的正式样本复杂性界限;编译到硬件的约束限制了对 GPU 高效结构的恢复;以及将即时压缩与模型缩减相结合的联合目标。这些组件一起将 LLM 推理重新构建为具有显式近似保证和面向部署的加速约束的测量和恢复问题。