论文

数据集稀缺限制了多语言嵌入模型的稳健评估:斯拉夫语言案例研究

Dataset Scarcity Limits Robust Evaluation of Multilingual Embedding Models: A Case Study of Slavic Languages

模型评测评测方法与指标

摘要

多语言文本嵌入模型可以在广泛的 NLP 任务中实现知识的跨语言迁移,但它们的评估在高、中、低资源语言中仍然非常不平衡。在本文中,我们提出了一个二维框架,专门用于分析数据集稀缺情况下的多语言嵌入基准,并将其应用于 MTEB 基准的斯拉夫语言子集。该框架区分了特定任务评估和跨任务评估,同时联合分析三个互补的方面:(1)排名稳健性,(2)模型一致性,(3)证据强度。在特定任务级别,我们评估模型排名在排名方法和基准数据集组成发生变化的情况下的稳定性。在跨任务层面,我们评估模型在一种语言中跨不同任务进行泛化的能力。为了量化基准结论的可靠性,我们引入了证据强度评分,该评分考虑了数据集的可用性、多样性和稳健性评估。我们的分析揭示了严重的基准稀疏性,许多斯拉夫语言任务对依赖于单个数据集或高度相关的基准集合,限制了得出可靠结论的能力。跨任务分析揭示了一小群高度可转移的模型,最引人注目的是 llama-embed-nemotron-8b、multilingual-e5-large-instruct 和 Qwen3-Embedding 变体,它们在斯拉夫语言和任务中始终表现良好。总体而言,结果表明,基准排名和稳健性结论必须与其证据强度的某些表示法结合起来解释,并强调基准稀缺性是可信多语言评估的主要障碍。