论文

OmniACBench:评估全模态模型中基于上下文的声学控制的基准

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

模型评测基准与评测资源

摘要

大多数全模态模型的测试平台通过文本输出评估多模态理解,因此不清楚这些模型是否能够正确说出它们的答案。为了研究这个问题,我们引入了 OmniACBench,这是一个评估全模态模型中基于上下文的声学控制的基准。给定口头指令、文本脚本和图像,模型必须以适当的语气和方式大声朗读脚本。 OmniACBench 包含 3,559 个经过验证的实例,涵盖六种声学特征:语速、发声、发音、情感、全球口音和音色。对八个模型的广泛实验揭示了它们在所提出的设置中的局限性,尽管它们在先前的文本输出评估中表现出色。我们的分析表明,主要瓶颈不在于处理单个模态,而在于集成多模态上下文以生成忠实的语音。此外,我们还确定了三种常见的失败模式——弱直接控制、失败的隐式推理和失败的多模态基础——为开发能够有效表达响应的模型提供了见解。