论文

优先于证据:基于 LLM 的 L2 发音反馈中的刻板印象驱动诊断

Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

模型评测模型行为与机制分析

摘要

大语言模型 越来越多地用于第二语言 (L2) 英语学习中的书面发音反馈,假设它们的诊断是基于提供的语音证据而不是预训练的先验。这一假设在 1,800 个 L2-Arctic 话语上进行了测试,涵盖六个 L1 背景、三个支持音频的 LLM、四个发音维度以及从纯文本基线到数字声学特征和原始音频的五个证据条件。每个(话语 x 模型 x 条件 x 维度)单元格根据三个指标进行评分:针对标准标签的评级准确性 (RA)、在没有 真值 的情况下评估内部一致性的证据一致性 (EC) 以及针对标准证据评估的证据依据正确性 (GC)。结果显示了模型中的三个发现。首先,评级准确性和有根据的推理脱钩:39.6% 的判断单元包含支持错误评级的内部连贯推理,而只有 15.8% 的推理支持正确评级。其次,音素级反馈收敛到 L2 英语难度音素的固定库存,该库存在所有六个 L1 背景和所有证据条件中重复出现。第三,只有当提供的功能直接探测目标维度时,声学证据才能提高评级:文本化的 F0 范围将所有三个模型的音高变化证据一致性从 (0.18-0.19) 提高到 (0.45-0.62),而需要目标与实现对齐的重音和音素正确性仍然没有基础。没有文本化 F0 值的相同音频波形不会重现这种改进。这些发现表明,当前的通用 LLM 作为外部计算发音证据的语言器比作为独立的诊断引擎更可靠。