论文
文本乐谱可能会错过波形使用:Qwen2-音频量化案例研究
Text Scores Can Miss Waveform Use: A Qwen2-Audio Quantization Case Study
摘要
语音语言模型的训练后量化通常用文本输出分数和标称位宽度来概括。这些数字本身并不能建立依赖于记录中缺失的信息或特定运行时的效率的行为。我们引入了一个评估协议,它分别测试词汇输出、转录不足端点和测量的打包实现。在 Qwen2-Audio 案例研究中,翻译选择的 6 位分配在冻结的英语到德语重播中将 chrF 提高了 2.36,配对 95% 的引导间隔 [1.04, 3.62],但在说话人不相交的情感识别方面损失了 3.91 个百分点。在相同的6位预算下,统一结构控制比选择的分配达到了更高的情感准确性,并且前层控制在相同冻结集上通过点估计也更高。在 7 位时,chrF 提高了 3.28,区间为 [2.08, 4.59],针对 FP16 的情感区间包括零,并且相同预算的前层控制仍然超出所选分配。一项单独的匹配预算 4.08 位研究发现,每个测试的低位分配都有大约 10 点的情绪缺陷,并且与冻结对照相比,选择分配没有优势。最后,去量化的平均 6 位模拟保留了 FP16 峰值内存。该案例研究确定了词汇输出、波形相关行为和标称精度之间的精度相关不匹配。它没有建立低位语音模型的普遍失败或所选分配的部署优势。