TurboVec:通过密码本不经意量化实现企业 RAG 经济高效的私有检索的案例研究
TurboVec: A Case Study in Cost-Efficient Private Retrieval for Enterprise RAG via Codebook-Oblivious Quantization
摘要
检索增强生成 (RAG) 系统越来越多地为企业 LLM 应用程序提供支持,但向量检索层引入了两个尚未充分探索的挑战:(1) 经过训练的码本量化器可能会在索引构建期间暴露语料库统计数据,从而在多租户部署中创建泄漏通道,以及 (2) 用于租户隔离的事后过滤会降低选择性查询的召回率。我们研究 TurboVec,这是一种基于 TurboQuant 构建的开源向量索引,TurboQuant 是一种不需要依赖语料库的训练的码本标量量化器。在 DBpedia OpenAI 嵌入基准(d=1536,100K-999K 向量)上,在所有尺度的 Recall@5 中,TurboQuant 4 位在相同内存预算下的性能优于经过训练的 FAISS 产品量化 8.5-8.9 个百分点。与 HNSW (R@5=0.991) 和 IVF-PQ (R@5=0.840) 相比,TurboQuant 占据了一个独特的设计点:比未经训练的 IVF-PQ 更高的召回率,但内存比 HNSW 少 4-8 倍。 TurboVec 部署在 Snowpark 容器服务上,在 100K 向量下实现了 11 毫秒的中值查询延迟,而仓库强力扫描的延迟时间为 707 毫秒。内核级白名单过滤在 10-1000 个租户工作负载中保持 0.86-0.93 Recall@10,而过滤后基线则为 0.09-0.19。忽略码本的设计将成员资格推断准确度降低到接近随机 (50.0%),而 PQ 码本的准确度为 57.3%。局限性包括单个数据集评估、未压缩的 HNSW 比较以及仅对合成数据进行隐私评估。