论文
重新思考语音基础模型 微调:更好的 SFT 还是更好的匹配?
Rethinking Speech Foundation Model Fine-tuning: Better SFT or Better Match?
摘要
有监督的 微调 (SFT) 被广泛用于使自监督语音表示适应下游分类任务。在单个预训练检查点下观察到的小收益通常被解释为方法级别的改进,即更高的可达到的性能上限。我们表明,这样的结论并不总是可靠,因为 SFT 结果很大程度上取决于特定的预训练实例。我们对 3 个 SUPERB 分类任务进行了系统研究,评估了来自 wav2vec~2.0、HuBERT 和 WavLM 的 9 个预训练检查点的 8 个 SFT 变体,并在代表性基础规模模型上进行了多种子重复。我们发现统计上无法区分的顶级组 SFT 配方的身份通常依赖于检查点,在预训练实例之间的可转移性有限。这些发现表明,许多报告的下游收益反映了实例和种子依赖的启发匹配,而不是普遍提高了可达到的性能上限。