论文
Tevatron-Elastic:用于训练 Elastic 检索器 和重新排序器的统一抽象
Tevatron-Elastic: A Unified Abstraction for Training Elastic Retrievers and Rerankers
摘要
单一模型规模挑战了生产检索系统的灵活性:一些设置需要更快,另一些设置需要更小的索引,并且正确的权衡会随着工作负载的变化而变化。在信息检索 (IR) 的背景下,基于 Transformer 的模型可以通过三种方式变得更小——使用更少的层、通过上层传递更少的词元或生成更短的嵌入——并且每种方式都节省不同的计算资源。这些选项每次都被研究一个,每个选项都有自己的方法,有自己的代码和训练设置,这使得它们很难组合或适应新模型。我们提出将所有三个都归入一个简单的抽象:单个对象命名模型可以运行的任何大小,并且一个简短的时间表列出了要训练的大小。然后训练会产生一个服务于所有这些规模的检查点,并且在部署时用户选择其中任何一个。相同的抽象涵盖了 检索器 和重新排序器以及编码器和解码器模型,因为它通过 Hugging Face Transformer 已经公开的接口工作;新的主干是配置更改,而不是新的建模代码。先前的方法——Matryoshka 嵌入、早期退出、2D~Matryoshka(例如星巴克)和分层词元压缩——成为我们统一抽象的特例。同一接口还支持 Matryoshka~LTC (MLTC),它在一个 检索器 检查点中联合训练多个词元压缩比。为了验证我们的框架,我们在三个骨干网和两个任务中训练了 20 个检查点:质量曲线平滑,一个检查点的成本比针对单一大小训练的模型要少,并且一项对照研究证实了挂钟加速。我们发布框架和所有检查点作为构建弹性检索系统的资源。