论文
超越多语言平均值:MTEB-PT,葡萄牙语句子编码器的基准
Beyond Multilingual Averages: MTEB-PT, a Benchmark for Portuguese Sentence Encoders
摘要
尽管葡萄牙语是世界上使用最广泛的语言之一,但在文本嵌入评估中的代表性仍然不足。因此,嵌入模型通常是根据英语或多语言指标来选择的,而它们在葡萄牙语中的有效性仍不清楚。我们提出了 MTEB-PT,这是一个从 MMTEB 子集构建的葡萄牙语基准,包含 14 个涉及语义文本相似性 (STS)、分类、检索和重新排名的现有数据集。我们使用这个基准测试在统一协议下评估 17 个开源和闭源嵌入模型。我们的结果表明,葡萄牙语的表现强烈依赖于任务:多语言排名不能可靠地预测跨任务系列的葡萄牙语特定表现,没有单一模型主导所有设置,具有更强长上下文能力的模型在较长输入任务(例如检索和重新排名)上特别有利。该基准还表明,特定语言的 微调 仍然可以提高葡萄牙语的模型性能,特别是在与适应数据最匹配的任务类型上。为了检查这种效果,我们使用葡萄牙对比监督和俄罗斯套娃表示学习(MRL)对三个代表性骨干模型进行了微调。这些基于基准的基线在 STS 上产生了最大的收益,与训练期间使用的主要对称监督一致,同时还改进了检索并在维度截断下保持竞争力。我们发布了 MTEB-PT 基准、微调模型以及训练和评估代码。