APQF:具有自适应 微调 的代理分析引导结构化修剪和混合精度量化
APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning
摘要
现代深度神经网络实现了强大的性能,但其规模使其成本高昂且速度缓慢,尤其是在资源受限的边缘设备上。修剪和量化可以解决这个问题,但依赖于手动、专家选择以及难以跨架构应用的算法。统一设置还会忽略各个层对压缩的响应差异,这会降低准确性。我们引入了 APQF,这是一种代理分析引导框架,它将结构化修剪、混合精度量化感知训练和准确性恢复结合在一个自动化管道中。分析代理测量成本在模型中的分布情况以及每个部分对剪枝的敏感程度,这些证据驱动每层剪枝比率、每层位宽和恢复策略,所有这些都由 LLM 规划者提出并在执行前进行验证。据我们所知,APQF 是第一个将 LLM 引导的、基于分析的决策与针对 CNN 和视觉 Transformer 的完全训练感知的修剪和量化管道相结合的框架。我们使用 ImageNet-1k 和 CIFAR-10 在 ResNet、VGG7、ViT、DeiT 和 Swin 上评估 APQF。在 ImageNet 上,它将计算量减少到原始位操作的 5.6-7.7%,减少了 13-18 倍,同时保持接近基线的精度,并且在 200K 图像预算下,它在 Top-1 中比现有的联合剪枝和量化方法高出大约 17 个百分点。在 CIFAR-10 上,它在五种架构中的四种上比该方法压缩得更好。在 VGG7 上,仅使用 0.41% 的基线位操作即可达到 93.15%,这是该压缩级别上改进其全精度基线的唯一方法。消融表明,统一压缩在匹配计算方面损失了最大的准确性,并且向规划器隐瞒分析数据会损害每个模型。六个 LLM 规划器(包括免费开放重量规划器)在 Swin-Tiny 上均达到 97.4-97.9%。