论文

SEA-LION-Embedding:东南亚开放且可复制的文本嵌入

SEA-LION-Embedding: Open and Reproducible Text Embeddings for Southeast Asia

模型训练预训练

摘要

文本嵌入是许多下游应用程序的基础,因此鲁棒性对于现实世界的 NLP 非常重要。然而,最近最先进的嵌入模型是不可重现的,因为它们依赖于封闭或未公开的训练数据,并且对于东南亚语言来说仍然不够稳健。我们提出了 SEA-LION-Embedding,这是一种完全开放且可重现的东南亚语言文本嵌入管道,仅在公开数据上进行训练,并用它来研究稳健嵌入设计的三个核心因素:数据组成、训练目标和基本编码器初始化。 SEA-LION-Embedding 在 SEA-BED 上取得了最先进的结果,同时能够对该区域的稳健文本嵌入进行系统且可重复的分析。