论文

Whisper 模型训练后压缩下的时间税收复合

Temporal Taxation Compounds Under Post-Training Compression of Whisper Models

模型评测鲁棒性、公平性与可信度评测

摘要

自动语音识别模型经过完全精确的人口统计公平性审核,但交付生产的模型已经过量化、修剪和提炼。我们询问训练后权重压缩(它改变模型权重而不是音频信号或其特征表示)是否会在人口群体之间重新分配错误负担。在 Fair-Speech、Common Voice 25 和 AfriSpeech-200 上的 Whisper 系列中,Whisper-large-v3 的 50% Wanda 修剪急剧扩大了 Fair-Speech 上黑人/AA 与亚洲人的时间税收差异:服务最差和服务最好的群体之间的绝对字错误率差距增加了一倍以上;假设每个转录错误需要 5 秒的纠正时间,则每分钟语音的纠正时间从 30 秒增加到 64 秒。这个 +111% 的相对增长对于假设的每个错误成本来说是不变的,在音频质量控制下仍然存在,并且仅通过波束搜索解码部分缓解,这仍然留下 +86% 的增长。在边缘模型大小下,INT4 HQQ 量化会使西非口音的灾难性转录循环复合五到七倍。相比之下,蒸馏缩小了 27 个评估设置(师生对、精度和数据集)中 21 个的人口统计学差距,例外情况集中在单个模型对上。我们将 Choi 和 Choi (2025) 的时间税收构造作为定量指标,并表明对全精度模型的单快照公平性审计并不能捕获压缩给已经边缘化的说话人带来的部署时间负担。