论文
HARNESS-LM:在赞助搜索检索中利用 SLM 的三阶段训练方法
HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval
摘要
在赞助搜索的竞争格局中,平衡检索质量和生产延迟是一项关键挑战。虽然基于小语言模型 (SLM) 的大型检索模型(例如 Qwen3-Embedding-4B/8B)在公共基准上设置了强大的上限,但它们在高吞吐量、延迟敏感的环境中的部署仍然不切实际。在本文中,我们提出了 HARNESS-LM (HLM),这是一个三阶段训练框架,用于将大规模 检索器 的功能转换为紧凑、经济高效的模型。该方法包括:(1)通过微调十亿参数规模的SLM训练高性能参考(“老师”)检索器; (2) 通过 L2 目标对齐查询表示,将知识提炼到低于 600M 参数的学生编码器中; (3) 应用最终的对比细化阶段来优化学生的检索表现。我们还对关键设计选择进行了全面的实证研究,包括对齐目标、嵌入维度、模型规模、架构和优化策略,以确定在生产环境中最有效的配置。在真实的 Bing Ads 评估基准中,HLM 在多种设置下恢复了参考 检索器 超过 98% 的精度,同时在 NVIDIA A100 GPU 上将在线查询编码器延迟降低了 27 倍,吞吐量提高了 20 倍。 Bing Ads 上的在线 A/B 测试进一步显示,与使用已部署的 190M 参数模型在生产中运行的当前 检索器 整体相比,收入增加了 +1%,展示次数增加了 +0.6%,点击量增加了 +0.4%,这清楚地突出了 HLM 配方在现实世界赞助搜索设置中的实际功效。