论文

AudioDER:后训练 大型音频语言模型的重复数据删除增强推理数据集

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

模型训练合成数据

摘要

预训练大型音频语言模型 (LALM) 的最新进展展示了跨语音、声音和音乐的强大功能。为了使这些模型适应下游任务,而无需从头开始进行预训练,后训练 已成为广泛采用的范例。然而,后训练 的有效性关键取决于训练语料库的质量。我们观察到,现有的 后训练 语料库(通常是通过聚合公共音频数据集构建的)存在大量的声学冗余,因为其中许多数据集来自重叠的媒体平台。这种冗余导致重复暴露于类似的声学模式,尽管数据量增加,但导致性能回报递减。为了解决这个问题,我们提出了一个三阶段的数据构建管道,该管道执行声学冗余过滤,将保留的样本转换为具有思想链生成的统一的多项选择问答格式,最后应用质量验证和过滤。使用此管道,我们构建了 AudioRE,这是一个包含大约 286k 个实例的 后训练 数据集,涵盖声音、语音和音乐。 AudioRE 上的监督 微调 持续提高了 Qwen2-Audio-7B-Instruct 在不同音频理解和推理基准上的性能,优于在未经过滤的原始语料库上训练的模型,实例数量大幅增加。这些结果验证了我们的冗余感知数据构建管道和生成的 AudioRE 数据集的有效性,并进一步强调了最小化音频语言 后训练 中声学冗余的重要性。为了方便未来的研究,我们将发布 AudioRE 和微调的 Qwen2-AudioRE 检查点。