论文
用于联合多粒度 L2 评估和自然语言原理的微调语音LLM
A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales
摘要
自动 L2 语音评估可以分配熟练程度标签,但通常缺乏可解释性。我们提出了一种用于多方面、多粒度评估的以标题为指导的 SpeechLLM,通过结合监督 微调 和有界直接偏好优化的混合目标进行训练。该模型联合预测句子级别的序数标签(准确性、流畅性、韵律)、单词/音素级别的准确性,并在同一响应中生成自然语言基本原理。在 SpeechOcean762 上,我们的方法匹配或优于单粒度模型,同时与之前的方法保持竞争力。我们沿着两个轴分析基本原理可靠性:使用情感一致性(合理性)和基于提及的一致性(忠实性),与模型预测的自我一致性以及与 真值 标签的对齐。基本原理在句子级别上是合理的,但 忠实性 在单词/音素级别上会退化:引用稀疏且与 词元级 标签的对齐较弱。