论文

高效缩放音频模型:缩放、分辨率、适应性、精度和稀疏性的联合优化

Scaling Audio Models Efficiently: Joint Optimization of Scale, Resolution, Adaptation, Precision, and Sparsity

模型优化模型压缩

摘要

Whisper 等大型自动语音识别 (ASR) 模型必须跨内存和推理速度限制差异很大的硬件进行部署。我们提出了一个压缩框架,该框架沿着六个维度联合参数化 Whisper 部署:模型大小、时间分辨率、编码器词元步幅、低秩适应能力、权重精度和稀疏模式。所有轴均使用 NSGA-III 针对三个部署目标进行联合优化:字错误率 (WER)、推理 FLOP 和内存占用。在评估的 1,680 个候选配置中的 50 个中,我们描述了每个轴的条件效果,并确定了主导朴素单轴缩放的压缩组合,同时发现 1:4 结构化稀疏性无法在测试的恢复预算下恢复可接受的精度。我们报告测量的 WER 和驻留内存,使用分析 EffFLOP 作为搜索时计算替代项,并使用测量的实时因子 (RTF) 单独验证代表性推理配置。