论文
细粒度多维语音理解:数据流程、基准与模型
Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model
摘要
虽然语音 大语言模型 (LLM) 擅长基本语音识别等传统任务,但它们缺乏细粒度、多维感知。这种缺陷在他们努力解开微声学线索、声学场景和副语言信号等复杂特征时表现得很明显。由此产生的对现实世界语音的不完全理解从根本上阻碍了下一代感知和同理心语音系统的发展。从本质上讲,这种持续的感知限制主要源于三个相互作用的因素:稀缺的高质量表达数据、缺乏多维属性的细粒度建模以及对有限覆盖范围和粗粒度基准的依赖。我们通过三个支柱来应对这些挑战:首先,我们强大的数据管理管道解决了复杂的声学环境和长音频时间戳对齐挑战,以从视听源中提取高质量的自发语音语料库。其次,我们构建了 FMSU-Bench,这是一个涵盖 14 个语音属性维度的开创性基准,用于严格评估当前模型的细粒度、多维度语音理解能力。第三,在我们精选的语料库的支持下,我们推出了 FM-Speech。在解耦属性建模和渐进式课程 微调 框架的驱动下,它大大提升了细粒度、多维的声学感知。对 FMSU-Bench 的广泛评估表明,当前语音 LLM 在多维度、细粒度的理解方面仍需要显着改进。相比之下,FM-Speech 的性能大大优于当前的开源模型,为现实世界的语音理解建立了强大的范例。