论文
在大规模声音嵌入基准 (MSEB) 上对 LLM 进行基准测试
Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)
摘要
大规模声音嵌入基准(MSEB)已成为评估音频模型功能广度的标准。虽然最初的基线侧重于专用编码器,但向“音频原生”大语言模型 (LLM) 的转变提出了一种新的范例,其中单个多模态主干可以取代复杂的、特定于任务的管道。本文对领先的 LLM(包括 Gemini 和 GPT 家族的成员)的八个核心 MSEB 功能进行了严格的实证评估,以评估其功效和音频文本对等性。我们的结果表明,虽然在性能和鲁棒性方面仍然存在显着的模态差距,但“最佳”建模方法的经验证据仍然没有结论。最终,音频架构和级联架构之间的选择在很大程度上取决于特定的用例要求以及有关延迟、成本和推理深度的基本假设。