论文

联合优化架构与量化配置的大语言模型压缩

LLM Compression with Jointly Optimizing Architectural and Quantization choices

模型优化模型压缩

摘要

大语言模型的内存与计算需求使部署困难。从头训练小模型仍需要大量GPU训练,而压缩预训练模型是边缘部署的替代路径。除剪枝与量化外,神经架构搜索(NAS)也可用于压缩,但已有NAS方法通常限制搜索空间,并将架构选择与量化分开。研究提出可微NAS框架,在完整搜索空间中联合优化模型架构配置与线性层混合精度量化。实验显示更好的准确率与延迟平衡:相较先NAS后量化的顺序基线,在准确率相近时,推理最高快1.4倍;在延迟相近时,七项推理任务的平均准确率最高提高6%。