论文

Granite 嵌入多语言 R2 模型

Granite Embedding Multilingual R2 Models

模型训练预训练

摘要

我们推出了多语言 Granite Embedding R2 模型,这是一系列基于编码器的嵌入模型,用于跨 200 多种语言的企业级密集检索。这些模型扩展了以英语为中心的 R2 版本,增强了对 52 种语言和编程代码的支持、32,768 个词元上下文窗口(比 R1 扩展了 64 倍),以及跨多语言和跨语言文本搜索、代码检索、长文档搜索和推理检索数据集的最先进的整体性能。该版本由两个基于 ModernBERT 架构的双编码器模型组成,具有扩展的多语言词汇量:一个 311M 参数的全尺寸模型和一个通过模型剪枝和词汇选择构建的 97M 参数紧凑模型,该模型在 100M 参数下实现了任何开放多语言嵌入模型的最高检索分数。全尺寸还支持 Matryoshka 表示学习,以实现灵活的嵌入维度。这两种模型都经过治理监督的适合企业的数据训练,并根据 Apache 2.0 许可证发布(https://huggingface.co/collections/ibm-granite),旨在支持负责任的使用并实现不受限制的研究和企业采用。