论文
ML-Embed:多语言世界的包容性和高效嵌入
ML-Embed: Inclusive and Efficient Embeddings for a Multilingual World
摘要
高质量文本嵌入的发展正日益走向排斥性的未来,其定义是三个关键障碍:高昂的计算成本、忽视世界上大多数语言的狭隘语言关注点以及闭源或开放权重模型缺乏透明度,从而扼杀了研究。为了消除这些障碍,我们引入了 ML-Embed,这是一套基于新框架构建的包容性高效模型:3 维俄罗斯套娃学习 (3D-ML)。我们的框架在整个模型生命周期中以综合效率解决了计算挑战。除了俄罗斯套娃表示学习 (MRL) 的存储优势和俄罗斯套娃层学习 (MLL) 提供的灵活推理时间深度之外,我们还引入俄罗斯套娃嵌入学习 (MEL) 来提高参数效率。为了解决语言挑战,我们整理了一个大规模的多语言数据集,并训练了一套参数范围从 140M 到 8B 的模型。为了直接承诺透明度,我们发布了所有模型、数据和代码。对 430 项任务的广泛评估表明,我们的模型在 17 个评估的 MTEB 基准中的 9 个上创下了新记录,在低资源语言中取得了特别强劲的结果,为构建全球公平且计算高效的人工智能系统提供了可复制的蓝图。