论文

面向语义搜索的高效GPU检索

Efficient GPU Retrieval for Semantic Search

AI 基础设施向量数据库

摘要

LinkedIn 上的语义搜索必须从数亿个语料库中检索相关个人资料,以响应自然语言查询,例如“柏林从事支付工作的金融科技创始人”。部署的相关性策略是面向瓶颈的:必须满足每个活跃的不可协商的方面,并且预先存在的LLM分级相关性(GR)法官通过对方面等级进行固定的最小/中值聚合来实现这一点。相反,余弦相似度对证据进行平均,使一个方面掩模的强匹配在另一个方面失败,从而限制了第一阶段(L0)检索器的召回率。我们提出了一个策略一致的检索框架:嵌入被划分为八个类别监督片段,其分数在服务时遵循相同的最小值/中值规则;对于多向量检索,该分段分数是针对每个标记文档槽独立计算的,并在槽之间最大化。轻量级单槽 Stage-1 评分器可生成高召回率候选者,而尺度不变的相对规范门控可在训练、评估和服务中保持类别激活的一致性。在 21K 保留查询中,这种表示在匹配容量基线上提高了离线相关性,收益广泛分布在各个方面组合中。我们使用两级 GPU 架构为该框架提供服务:FP8 粗排序器对完整语料库进行评分,将每个分片容量提高 71%,将 Stage-1 matmul 吞吐量提高 36%,然后 FP16 阶段对过采样候选集进行精确重新排序,以每个分片副本超过 500 QPS 的速度恢复 99.6-99.8% 的全 FP16 召回率。在成员随机 A/B 测试中,在 GR 法官不变的情况下,探索性查询 Precision@10 从 63.7% 上升至 79.0%,导航 Precision@1 从 65.5% 上升至 74.7%,盲人评估独立确认 Precision@10 增益。