论文

当声调和字面意义出现分歧时:大型音频语言模型的声学语义不一致研究

When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models

模型评测基准与评测资源

摘要

跨模式的情感线索可能不一致(例如,讽刺或嘲笑赞扬),当依赖单一模式时可能会导致误解。大型音频语言模型(LALM)最近受到欢迎并应用于多模态情感识别,但它们解开声音和语义线索的能力,特别是在不一致的情况下,仍然没有得到充分探索。为了解决这一差距,我们引入了 CREMA-ASIS,这是一个专门为研究声音情感和语义情感线索之间的不一致而创建的数据集。 It pairs acoustic emotion labels with semantic sentiment polarities.使用此数据集,我们评估多任务框架内的 LALM 偏差,并进行分层分析以识别跨层的模态主导。我们的研究结果表明,LALM 与语义声学不一致的情况作斗争,很少预测不一致,并且 LALM 主要受语义信息的影响。然而,有监督的 微调 显着提高了我们 CREMA-ASIS 测试集上的 LALM 性能,同时保留了转录准确性和联合情感识别。 Results demonstrate potential for enhancing both acoustic and semantic understanding on out-of-domain data.