Audio Flamingo Next:用于语音、声音和音乐的下一代开放音频语言模型
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
摘要
我们推出 Audio Flamingo Next (AF-Next),它是 Audio Flamingo 系列中下一代、功能最强大的大型音频语言模型,旨在促进对语音、环境声音和音乐的理解和推理。与 Audio Flamingo 3 相比,AF-Next 引入了:(i) 更强大的基础音频语言模型,可显着提高各种音频理解任务的准确性; (ii) 用于构建超出现有学术基准的大规模音频理解和推理数据的可扩展策略; (iii) 支持长达 30 分钟的长且复杂的音频输入; (iv) 时间音频思想链,一种新的推理范式,明确地将中间推理步骤基于长音频中的时间戳,从而实现细粒度的时间对齐并提高可解释性。为了实现这些功能,我们首先对 Audio Flamingo 3 进行系统分析,以确定音频理解和推理方面的关键差距。然后,我们整理和扩展总计超过 100 万小时的新大型数据集,以解决这些限制并扩展现有的 AudioSkills-XL、LongAudio-XL、AF-Think 和 AF-Chat 数据集。 AF-Next 使用基于课程的策略进行训练,涵盖 预训练、中期训练和 后训练 阶段。跨 20 个音频理解和推理基准的广泛实验(包括具有挑战性的长音频任务)表明,AF-Next 的性能大幅优于类似大小的开放模型,并且与更大的开放权重和封闭模型保持高度竞争,有时甚至超越。除了基准性能之外,AF-Next 还表现出强大的现实实用性,并且可以很好地迁移到未见过的任务,突出了其稳健性和泛化能力。除了所有数据、代码和方法之外,我们还开源了 AF-Next 的 3 个变体,包括 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner。