论文
工业物联网中设备上 LLM 推理的级联多粒度修剪
Cascaded Multi-Granularity Pruning for On-Device LLM Inference in Industrial IoT
摘要
在工业物联网 (IIoT) 边缘设备上部署 大语言模型 (LLM) 需要极度压缩,但现有的结构化修剪方法由于一次性重要性估计而在高压缩比下崩溃,并且其跨架构行为仍然不可预测。本文提出了一种级联多粒度修剪框架,该框架以从粗到细的顺序删除层、注意力头和前馈通道,并在阶段之间进行轻量级低秩恢复以重新估计组件重要性。信息论分析激发了这种排序,结构独立假设 (SIA) 被形式化为可检查条件,预测每个组件修剪标准对于给定架构是否可靠:多头注意力 (MHA)+GELU 设计满足 SIA,而分组查询注意力 (GQA)+SwiGLU 设计违反它。在涵盖 88M 至 6.25B 参数模型的轴承故障诊断中,该框架将 MHA+GELU 架构上可实现的压缩率扩展至 13.8 倍,准确率达到 83.82%(比最强基线高出 3.70 个百分点 (pp)),同时在违反 SIA 的 GQA+SwiGLU 架构上出现约 74pp 的准确度崩溃。压缩模型部署在采用 NVIDIA DGX Spark 的工业回转轴承故障诊断平台上,可将推理延迟降低高达 67.2%,将峰值内存降低 62.5%,展示了 IIoT 边缘推理的可行性。