论文
SelectInfer:设备上 LLM 的选择性神经元加载和计算
SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs
摘要
大语言模型 (LLM) 在一系列自然语言处理 (NLP) 任务中展示了卓越的能力,但其高计算和内存需求对资源受限的边缘设备上的部署提出了重大挑战。现有的模型压缩和优化方法通常依赖于粗粒度修剪或量化,这可能会影响准确性或需要重新训练和 微调。在这项工作中,我们引入了 SelectInfer,这是一种神经元级优化框架,可通过选择性神经元加载和计算在边缘设备上实现高效的 LLM 推理。通过使用离线 LLM 分析器分析和识别特定任务和通用神经元,SelectInfer 实现了两个关键优化:选择性加载(通过有选择地加载在离线阶段被识别为最重要的神经元子集来减少内存占用)和选择性计算(在运行时仅动态计算最相关的神经元)。对多个数据集的评估表明,SelectInfer 在保持任务性能的同时显着减少了内存占用和计算量,使其成为在边缘设备上实现 LLM 部署的实际步骤