论文
ParA-LLM:副语言和声学语音理解的统一方法
ParA-LLM: A Unified Approach to Paralinguistic and Acoustic Speech Understanding
摘要
音频大语言模型的最新进展已经实现了人类水平的语音识别,但现有系统难以捕捉副语言方面,例如说话者特征、表达变化和环境声学条件。为了解决这个问题,我们设计了一个包含 22 个副语言特征的框架,并创建了超过 120 万个音频-QA 对的数据集。我们开发了 ParA-LLM,通过两阶段课程进行培训:首先是单属性问题以构建基础知识,然后是多属性问题以对说话者和声学特性进行联合推理。我们还发布了 ParA-Bench,这是一个涵盖说话者语音、声学和混合类别的 6,000 个多项选择题的基准,其中 GPT-4o-Audio 等前沿模型的准确率仅为 36%。在 ParA-Bench 上,ParA-LLM 比 GPT-4o-Audio 等最先进的音频 LLM 领先 7.5%,在 MMAU-Pro Speech 上领先 1.13%,在 MMAR Speech 上领先 7.49%。