论文

MelT:通过非均匀 DFT 实现的便携式单 GEMM Mel 音频前端,可测量 GPU 上的延迟和能量增益

MelT: A Portable, Single-GEMM Mel Audio Frontend via Non-Uniform DFT with Measured Latency and Energy Gains on GPUs

模型推理推理加速

摘要

现代神经音频模型在加速器上运行,其峰值吞吐量来自密集矩阵乘法,越来越多地出现在边缘和数据中心。然而,传统的声学前端——短时傅里叶变换(STFT),然后是稀疏梅尔聚合——仍然是一个以快速傅里叶变换(FFT)为中心的多级管道,其执行开销与主导推理堆栈的密集线性代数不同。这项工作引入了 MelT,这是一种便携式单级 Mel 前端,可预先计算 Mel 间隔非均匀离散傅立叶变换 (NDFT) 基,并通过通用矩阵乘法 (GEMM) 将其应用于时域帧。贡献在于计算设计原理:将 Mel 特征提取与供应商特定的 FFT 原语解耦,并将其降低到已经优化的矩阵乘法基板加速器上。它不是一个新的谱算子。 MelT 的直接投影比 FFT 管道执行更多的算术。然而,在神经音频前端的紧凑分辨率体系中,从 Apple A18 Pro 到 NVIDIA H100,它实现了 1.64 倍到 3.29 倍的延迟减少以及高达 3.03 倍的测量活动能量减少。所有收益都是平台内比较,并伴有任务级验证。在中等尺寸和更大尺寸的冻结 Whisper 模型上,字错误率在统计上与本机前端保持相同; VoxCeleb1 上的说话者属性分类是非劣质的。倒谱扩展 MFCCT 保留了临床呼吸功能不全分类任务 (SPIRA) 的实用性,同时改进了 MFCC 基线。这些结果表明,在此处评估的加速器的实际机制中,硬件对齐而不是算术计数可以控制特征提取的实现成本。