论文
EvoAudio:音频理解的递归自我改进
EvoAudio: Recursive Self-Improvement for Audio Understanding
摘要
音频语言模型对所说内容的理解比对声音的理解要好得多。缩小这一差距需要的不仅仅是数据。详细的声学注释成本高昂,来自更强模型的标签继承了它们的错误和限制,并且固定数据无法随着学习者的进步而适应。因此,我们提出了 EvoAudio,一种用于音频理解的递归自我改进系统。据我们所知,它是第一个在一个闭环中发展模型、波形、问题和难度的项目。 EvoAudio 使用当前模型的性能来设置下一个训练数据的重点和难度。然后,音频工具库构建问题,其答案来自音频的制作方式,提供可验证的监督,无需新的人工注释。强化学习更新模型,验证决定是否进入下一轮进化。在 13 轮中,EvoAudio 在 MMSU、MMAU-Pro 和 MMAR 上使用不同的音频编码器和语言骨干改进了 5 个模型。它实现了每个骨干网的最高平均水平,将整体性能提高了 6.3 个百分点。改进会在连续的回合中展开,每个更强的模型都会开始下一轮。