论文
m3BERT:现代、多语言、俄罗斯套娃双向编码器
m3BERT: A Modern, Multi-lingual, Matryoshka Bidirectional Encoder
摘要
嵌入模型在搜索和广告等工业信息检索系统中至关重要。然而,现有的预训练模型通常表现出固定的架构和嵌入维度,这在使其适应具有不同业务驱动约束的不同部署场景时提出了重大挑战。常见的做法是使用 微调,从用于资源受限任务的较大预训练模型中进行部分参数初始化。这种方法通常不是最理想的,因为预训练和下游使用之间的不一致阻碍了预训练好处的充分实现。为了解决这个限制,我们引入了 m3BERT:一种现代、多语言、俄罗斯套娃双向编码器,它具有新颖的预训练策略,可以联合优化 Transformer 层和多个嵌入维度的表示。这使得单个模型能够针对不同的资源和准确性目标进行定制,同时保持与预训练的一致性。 m3BERT 结合了最新的架构改进,采用三阶段预训练:单语言预训练、为不同用户群服务的多语言适应,以及在大规模 Web 领域语料库上进行关键的持续预训练以增强商业检索的实用性。 m3BERT 的性能显着优于大型工业检索数据集 Bing-Click 中最先进的嵌入模型,展示了其作为资源感知工业检索系统的有效基础的实用多功能性。对公共数据集的进一步实验也证实了我们的多粒度俄罗斯套娃预训练策略的总体有效性。