论文

苹果到苹果?走向可比的跨语言语言模型评估

Apples to Apples? Towards Comparable Crosslingual Language Model Evaluation

模型评测评测方法与指标

摘要

能够进行公平比较的语言模型的跨语言评估仍然是多语言 NLP 中的基本挑战。现有的研究采用了各种具有不同理论依据的下游任务和内在指标,但很少有实证研究来验证这些方法是否能产生有意义的跨语言结论。我们使用受控单语语言模型系统地检查跨语言评估方法,该模型在具有不同标记器词汇量和模型大小的并行数据上进行训练,并进一步验证我们在多语言 LLM 上的发现。我们进一步讨论了跨语言实现可比下游评估的挑战。我们的结果表明,几种广泛使用的标准化指标引入了源于标记化、编码和拼写差异的跨语言偏差。相比之下,在语义等效序列上计算的句子级负对数似然提供了更有意义和一致的跨语言比较。