论文

CASA:使用语音编码器和 大语言模型 进行内容声学口语评估

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

应用与实践行业应用

摘要

自动口语评估(ASA)的研究越来越多地采用多模态语音大语言模型来评估学习者的口语表现。然而,现有研究对声学和内容信息如何有助于预测以及最终性能的稳定性进行了有限的分析。我们提出了 CASA,这是一种结合 Whisper-medium 和 Qwen3.5-2B 的更简单的架构,可实现最先进的性能,同时提供语音传输和内容之间更可解释的分离。在 Speak & Improve Corpus 2025 上,CASA 的均方根误差 (RMSE) 达到 0.358,比之前的最佳 RMSE 有所提高,同时使用了大约一半的估计推理参数。该通用架构旨在适应其他 ASA 语料库,无需进行结构更改,并依赖于三个手工制作的流畅性特征。通过消融和重复运行,我们分析了声学和内容信息的单独和互补贡献,检查性能变异性,并证明 大语言模型 推理对于 无需训练 内容验证的潜力。