论文
SkMTEB:斯洛伐克海量文本嵌入基准和模型适配
SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation
摘要
我们推出了 SkMTEB,这是第一个针对斯洛伐克语(一种资源匮乏的西斯拉夫语言)的综合 MTEB 式文本嵌入基准,包含跨 7 种任务类型的 31 个数据集,几乎是斯洛伐克语现有多语言基准覆盖深度的 4 倍。我们对 31 个嵌入模型的评估表明,大型指令调整多语言模型实现了最强的性能,而针对 NLU 任务训练的现有斯洛伐克特定模型迁移到嵌入任务的效果很差。为了满足高效、可本地部署的斯洛伐克嵌入的需求,我们通过将词汇修剪和 微调 应用于多语言 E5 模型来开发 \texttt{e5-sk-small} (45M 参数)和 \texttt{e5-sk-large} (365M)。尽管尺寸减少了高达 62%,但我们的开源模型通过专有 API 实现了具有竞争力的性能,同时仍然可在本地部署以进行语义搜索和检索增强生成 (RAG)。我们公开发布基准、模型、数据集和代码,希望我们的方法为其他资源不足的语言提供可复制的路径。