论文
多语言嵌入探针无法在学习者语料库中推广
Multilingual Embedding Probes Fail to Generalize Across Learner Corpora
摘要
多语言嵌入模型是否编码了熟练程度的语言通用表示?我们通过对七个嵌入模型 (0.3-8B) 的隐藏状态激活训练线性和非线性探针来研究这一问题,以预测来自九个语料库和七种语言的学习者文本的 CEFR 熟练程度。我们将五种探测架构与在表面级文本特征上训练的基线进行比较。在分布内评估下,探针实现了强大的性能(二次加权 Kappa $\approx0.7$),大大优于表面基线,中间层始终产生最佳预测。然而,在跨语料库评估中,所有探针类型和模型大小的性能都会崩溃。残差分析表明,分布外探针趋向于预测均匀分布的标签,这表明学习到的映射捕获了语料库特定的分布属性(主题、语言、任务类型、评级方法),而不是抽象的、可转移的熟练程度维度。这些结果表明,当前的多语言嵌入并不能直接编码语言一般熟练程度,这对基于表示的熟练程度自适应语言技术方法具有影响。