论文

Afrispeech 语义:评估跨领域和口音的口语模型中的音频语义推理

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents

模型评测基准与评测资源

摘要

音频语言模型 (ALM) 越来越多地用于基于语音的理解,但它们执行转录之外的语义推理、文本到音频检索、字幕和问答准确性的能力仍然没有得到充分的基准测试。特别是,人们对口音变化、领域转移和语义过度推理对音频推理的影响知之甚少。我们评估了五种语义和副语言推理任务的音频语言模型:蕴含、一致性、合理性、口音漂移和口音限制。总的来说,这些任务评估模型以口语音频作为主要证据来源进行推理的能力,包括是否可以通过音频推断、矛盾或不确定文本假设,陈述是否与口语内容一致或冲突,在给定话语的情况下主张是否合理,以及模型预测在口音变化中是否保持稳定或适当限制。这些发现强调了当前音频推理评估的关键局限性,并希望为更稳健和公平的 ALM 设计和评估提供指导