论文

关于跨学习任务、语言和基准数据集的多语言文本嵌入排名的稳健性

On the Robustness of Multilingual Text Embedding Rankings Across Learning Tasks, Languages, and Benchmark Datasets

模型评测评测方法与指标

摘要

大规模多语言文本嵌入模型在研究和工业中都发挥着至关重要的作用,但它们在特定语言、多任务设置中的行为仍然没有得到充分理解。尽管 MTEB 等基准测试平台报告了 250 多种语言的结果,但有关模型优越性的结论通常取决于数据集组成和性能聚合方法的隐式选择。为了解决这一差距,我们提出了 MTEB 中多语言模型性能稳健性的元研究,应用了一组不同的多标准决策排名方案,并引入了两个稳健性指标:数据集组成稳健性(排名对数据集组成变化的敏感性)和排名方案稳健性(对聚合方法变化的敏感性)。它们可以对不同评估设计下基准结论是否保持稳定进行系统的敏感性分析。我们对五种语言(英语、法语、德语、印地语和西班牙语)的九项任务(例如分类、聚类、检索)进行了深入分析,并发布了大约 230 种其他语言的结果。特定于任务的分析表明,基于 LLM 的大规模模型通常是稳健的顶级表现者,尽管并不统一(例如,在检索任务中),而与任务无关的结果表明,只有一小部分模型在任务、排名方案和数据子样本中保持一致的强大能力。