论文

Whisper-AuT:用于高效音频的域自适应音频编码器-LLM 训练

Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training

模型训练监督微调与指令调优

摘要

音频原生 大语言模型 (audio-LLM) 通常使用 Whisper 作为其音频编码器。然而,Whisper 只接受了语音数据的训练,对音乐和环境声音的表现很弱。这迫使下游音频 LLM 通过对大规模非语音数据进行广泛训练来进行补偿。我们展示了 Whisper-AuT,这是一种由 微调 Whisper-large-v3 在语音 (80%)、环境声音 (10%) 和音乐 (10%) 总计约 20M 样本的精选混合上获得的域自适应音频编码器。完整的编码器-解码器以 seq2seq 字幕目标进行端到端训练;然后解码器被丢弃,仅保留编码器。线性探针评估表明,与原始 Whisperlarge-v3 编码器相比,Whisper-AuT 在 ESC-50(环境声音)上实现了 +23.0%,在 GTZAN(音乐流派)上实现了 +5.0%,在语音命令(关键字识别)上实现了 +0.7%。 Whisper-AuT 被设计为音频 LLM 架构中 Whisper 的直接替代品,其目标是通过为非语音域提供更强的初始音频表示来降低下游训练成本。