论文

波兰语和欧洲语言的参数高效检索器

Parameter-Efficient Retrievers for Polish and European Languages

摘要

稠密检索系统日益依赖拥有数十亿参数的语言模型,其内存与计算需求使大规模索引、频繁语料更新和低延迟服务的成本升高。本文提出三阶段训练流程,构建能够与更大模型竞争的紧凑高效检索器。流程结合跨语言对齐、关系知识蒸馏和对比微调,不需要原始真实相关性标签,全部监督来自作为教师的强嵌入模型与重排序器。基于这一流程,研究开发PolDense和EuroDense,二者均支持最长8192词元的上下文。PolDense由六个波兰语检索器组成,参数量从1700万到10亿;EuroDense拥有4.35亿参数,支持九种欧洲语言。评测覆盖41个波兰语任务和150个多语检索任务,显示出良好的质量与效率权衡。PolDense-1B超过了评测中参数量最高达90亿的检索器,整个PolDense系列在不同模型规模上形成帕累托前沿。在所测参数量低于10亿的模型中,EuroDense按任务平均及语言平均表现均排名第一,并在九种语言中的七种领先。全部模型已公开发布。