论文

使用 LLM 带注释的训练数据扩展密集检索:电子商务赞助搜索的结构化挖掘和渐进式课程

Scaling Dense Retrieval with LLM-Annotated Training Data: Structured Mining and Progressive Curriculum for E-Commerce Sponsored Search

模型训练合成数据

摘要

我们如何在不依赖点击信号或手动注释的情况下,为生产规模的密集检索模型生成高质量的训练数据?这个问题对于电子商务赞助的搜索至关重要,其中基于点击的训练受到位置偏差和尾部查询稀疏性的影响,并且数亿个查询项目对规模的手动标记在经济上是不可行的。我们的工作是由以下见解驱动的:异构检索系统在它们检索的大多数项目上存在分歧,这种分歧创造了结构化训练信号的自然来源——所有系统都同意的简单肯定,只有词汇系统发现的硬否定,以及只欺骗一个系统的硬否定。作为我们的关键创新点,我们将三个想法结合到一个端到端的管道中:(a) 使用来自三个生产系统的排名元数据进行多通道检索挖掘,(b) 通过校准的三模型级联进行分级相关性注释,与训练有素的人类注释者达到 89.1% 的一致性,以及 (c) 三阶段渐进课程训练,组织跨五个难度级别的 2.4 亿多个训练示例。我们在沃尔玛的赞助搜索上部署了训练有素的两塔 BERT 模型,并针对由训练有素的第三方人工注释者标记的 30K 查询对其进行评估。首先,我们表明系统在点击训练的生产基线上实现了 +5.1% NDCG@10,其中尾部查询的增益最大。其次,我们发现令人尴尬的检索(评级为 0)从 8.7% 下降到 3.5%。第三,为期两周的在线 A/B 测试(每支有数千万个广告请求)确认广告支出增加 2.80%,点击率增加 1.4%,有效每千次展示费用增加 2.8%,点击转化率增加 2.9%。总的来说,我们的工作提供了一个实用且可扩展的蓝图,用于在生产检索系统中用结构化的 LLM 注释监督取代基于点击的训练。