论文

LOPA:通过潜在序数原型对齐增强口语评估

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

应用与实践结构化分析、预测与决策

摘要

在不断增加的模型规模和多模态输入的推动下,多模态 大语言模型 (MLLM) 已成为口语评估 (SLA) 的一个有前途的范例。虽然有效,但这种范式常常忽视了语言习得的内在顺序结构。本文围绕大规模 MLLM 的必要性,引入了 SLA 的潜在序数原型对齐 (LOPA),这是一种基于原型的正则化器,可直接在潜在空间上强制执行序数几何先验。再加上语义锚定层路由 (SALR),它可以从冻结的 Whisper 编码器中自适应地获取多深度表示,我们的框架实现了 0.361 的 RMSE。该性能可与十亿参数系统相媲美,而无需基于 LLM 的 微调。进一步的分析表明,SALR 与 LOPA 的协同作用提供了可解释的、符合标准的偏好,从而支持高效且序数感知的建模替代方案,以替代当前以扩展为中心的 SLA 模型。