论文

用于高效音频训练的异构感知数据集调度 大语言模型 训练

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

模型训练预训练

摘要

跨不同数据集训练通用音频 大语言模型 (ALLM) 对于整体音频理解至关重要,但由于数据集异质性,它面临着重大挑战,这通常会导致梯度冲突和收敛缓慢。尽管有其影响,但如何在训练期间明确管理这种异质性仍未得到充分探索,目前的做法主要依赖于统一的混合。在这项工作中,我们从收敛的角度分析多数据集 AudioQA 训练,并提出分组顺序训练(GST)。 GST策略性地将数据集组织成亲和力感知组,并通过渐进式调度协议引入它们,有效平衡并行训练的稳定性与顺序优化的效率。为了确保可扩展性,我们开发了基于梯度的亲和力指标,可以捕获数据集间的关系,而无需付出高昂的经验可转移性估计成本。对涵盖语音、音乐和环境声音的 14 个 AudioQA 数据集进行的广泛评估表明,GST 的收敛速度比标准并行训练快 30--40%,同时保持甚至超越混合所有训练的性能。我们的结果为高效的大规模 ALLM 优化提供了理论见解和实用的、与模型无关的框架。