论文
CARES:评估音频语言模型对说话者声音反应的理解
CARES: A Controlled Synthetic Benchmark of Speaker Reactions to Sound
摘要
自动音频场景描述将录音转变为情景的文本描述。一个困难是决定应保留音频的哪些元素,因为描述无法包含所有元素。注释者对此意见不一,导致很难获得基本事实。在这项工作中,我们首先定义基本事实,然后生成数据。我们关注音频事件,并用一个简单的规则定义声音显着性:当说话者对其做出可听见的反应时,声音是显着的。为了实现规模和多样性,一组受控场景确定了基本事实,并由语言模型编写对话。生成的语料库 CARES 包含 10,000 个双说话者场景。然后,我们在三个任务上对六种音频语言模型进行基准测试:识别场景、标记存在的声音以及对反应进行分类。我们证明这些模型可以听到声音,但错过了扬声器对声音的反应。