论文

SEABED:东南亚音频推理评估基准

SEABED: SouthEast Asian Benchmark for Evaluating Audio Reasoning

模型评测基准与评测资源

摘要

现代音频语言模型不再仅仅根据它们可以转录哪些单词来判断,而是根据它们是否能够对听到的内容进行推理:恢复存在于语气和韵律中的意义,区分方言和地方语言,并解决书面形式留下的歧义。现在,这种能力是通过越来越多的音频推理基准来衡量的,但几乎完全是用英语和通用域音频来衡量的。相反,东南亚(SEA)采用的基准继承了识别、翻译和副语言分类的英语任务分类法,因此测试模型是否听到 SEA 语音,而不是是否可以从中进行推理。我们介绍 SEABED,这是一个音频优先的问答数据集,旨在对 SEA 语音的语言和音频推理模型进行基准测试。 SEABED 包含一套 6 个音频推理任务,完全由真实的、公开的 SEA 语音语料库构建而成,产生 5,404 个问答对。我们评估了六种前沿和特定地区的音频大语言模型:即使是最先进的模型 Gemini 3.5 Flash 也只能达到 50.3% 的加权平均准确率。 SEABED 不仅评估答案的准确性,还评估模型陈述的推理是否以音频证据为基础。基准数据示例可在此处获取:此 https URL。