论文
Audio-Zero:用于细粒度音频推理的无标签自我进化
Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning
摘要
大型音频语言模型(LALM)在声学理解方面取得了快速进展,但它们仍然在细粒度音频推理(例如识别事件顺序、重复和持续时间)方面遇到困难。现有的 后训练 方法严重依赖昂贵的外部标签或仅提供粗略的语义信号。为了弥补这一差距,我们引入了 Audio-Zero,这是 LALM 领域第一个无标签的自我进化框架,可以改善细粒度的听觉感知和推理。 Audio-Zero 通过未标记的音频对比对构建了一个听觉自玩游戏:大多数玩家听到参考音频,而一个奇怪的听众听到一个微妙的变体。该模型首先生成描述所听到内容的线索,然后通过推理线索之间的不一致来识别奇怪的听众。由于奇怪的听众是通过构造而已知的,因此游戏提供了可验证的奖励,而无需任何带注释的答案。在 TREA、MMAU Test-mini 和 MMAR 上使用 Qwen2-Audio-7B-Instruct 和 Qwen2.5-Omni-7B 进行的实验表明,Audio-Zero 可以改善细粒度的音频推理,同时保留广泛的音频理解。进化和诊断分析进一步表明,越来越细粒度的听觉描述是从游戏压力中自然产生的。