论文
向量数据库中的私有检索的影子查询
Shadow Queries for Private Retrieval in Vector Databases
摘要
大语言模型(LLMs)越来越多地依赖信息检索(IR)系统,如检索增强生成(RAG),以在不进行昂贵重训练的情况下整合领域特定知识。这些系统通常将预计算的文档嵌入存储在基于云的向量数据库中。然而,此类嵌入易受嵌入逆向攻击(EIAs)影响,攻击者可重构其原始文本。现有防御方法,如添加噪声或缩放嵌入,通常隐私保护有限或显著降低检索性能。我们提出SHAQ(影子查询生成),一种基于语义分解和嵌入解耦的防御机制,以应对EIAs。SHAQ的核心思想是,EIAs依赖于嵌入与其原始文本之间的强耦合关系。因此,SHAQ不直接存储文档嵌入,而是利用生成式语言模型生成多样化的影子查询,以捕捉文档不同语义层面。这些查询随后被编码并存储,替代原始文档嵌入,从而实现文档语义的分解和嵌入与源文本的解耦。在多个不同IR数据集上的实验表明,SHAQ在提升隐私性的同时有效保持了检索性能,恢复率低至0.2104,比基线防御多防御19.50%的Token,且在MAP@10上达到最高0.7967,性能提升最高达5.53%。结果表明,语义分解与嵌入解耦为防御EIAs提供了一种有效且无需直接修改嵌入的替代方案。
