可解释、经过公平评估的自动化 L2 口语评估,突破单人上限以及为什么暂停编码不会改变 LLM 流利度分数
Interpretable, Fairly Evaluated Automated L2 Speaking Assessment that Beats the Single-Human Ceiling and Why Pause Encoding Does Not Change LLM Fluency Scores
摘要
第二语言 (L2) 英语学习者很少可以与伙伴一起排练口语。演讲也是最令人焦虑的技能。这些差距推动了自动口语练习和评分市场的快速增长。但只有准确、可解释、公平并且以正确的人类标准为基准的自动评分才值得信赖。我们构建了一个可解释的功能加 LLM 的混合体,用于自发的 L2 对话。我们在不符合人类标签的情况下根据 ICNALE 全球评级档案对其进行评估:约 80 名训练有素的评级员根据 10 项分析标准对 140 篇演讲进行了评级。我们使用可用音频对 130 个 L2 语音进行评分。确定性 De-Jong 语音计时复合材料达到 rho=0.764。与单个文本-LLM流畅度判断混合,相对于共识标准达到Spearman rho=0.818。这与共识的一致性优于 80 名经过培训的评估者中的 81%:高于中值评估者 (rho=0.73) 并接近最佳,并且约为可靠性校正最大值 (kappa_max=0.99) 的 83%。该共混物比单独的复合材料提高了 +0.054(配对自举 95% CI [0.017, 0.108],排除 0); LLM增加了连续复合细化的粗略流畅度排名。我们还报告了暂停编码上的受控空值,在此样本大小下,其效果限制在 +/-0.1 rho 以下。保持 LLM 和学习者单词固定,仅改变如何将暂停写入提示,内联暂停位置不会超过聚合暂停统计数据(-0.069,CI [-0.15,+0.08]),并且扎根的中间从句标准不会提供可靠的增益。流畅度信号来自测量的语音计时特征,而不是来自 LLM 的停顿写入方式。我们用两种一致的学习者隔离方法、配对引导 CI、独白负控制、经典测量的每个特征再现以及每个 L1 公平性审计来支持每个主张。