论文
MTEB-BR:巴西葡萄牙语的文本嵌入基准
MTEB-BR: A Text Embedding Benchmark for Brazilian Portuguese
摘要
葡萄牙语的文本嵌入没有专门的基准:评估依赖于翻译的语料库,例如英语 MS MARCO 或多语言覆盖,而本地任务分散且不整合。我们引入了 MTEB-BR,它是跨七个类别(分类、多标签分类、配对分类、语义文本相似性、聚类、检索和重新排名)的 22 个巴西葡萄牙语本地任务的基准,仅接受用葡萄牙语创建或找到的数据,并排除通过构造进行的翻译。我们评估了涵盖 23M 到 27B 参数的 93 个模型:73 个开放权重 API 和 20 个封闭商业 API。除了排行榜之外,我们还为每个标题比较报告了一个统计层:每个任务引导程序置信区间、配对引导程序显着性、改编自项目响应理论的任务和实例级别区分分析(每个任务区分模型的程度)以及跨排行榜相关性。三个发现很突出。该基准测试清楚地划分了大约十几层模型,尽管从统计数据来看,前六层模型太接近了。开放许可、自托管模型达到了领先水平,因此强大的葡萄牙语嵌入质量不需要商业 API。模型在全球多语言排行榜上的排名只能中等程度地预测其葡萄牙语排名(在 55 个共享模型中,Spearman rho = 0.75;其中一个模型排名第 3,这里排名第 49),因此本地基准衡量的是多语言委员会无法衡量的东西。我们发布了每项任务、我们的代码和公共排行榜,因此从业者可以在本地证据上选择葡萄牙语嵌入模型。