论文
生成检索的语义 ID 设计空间
A Systematic Study of Semantic ID Spaces for Generative Information Retrieval
摘要
生成信息检索 (GIR) 已成为一种变革性范式,将文档检索从传统的“检索和排序”工作流程转变为序列到序列生成,其中模型直接预测文档标识符 (DocID)。虽然众所周知,这些 DocID 的语义设计对于性能至关重要,但一个基本问题仍未得到充分探索:什么才是好的 DocID?当前的方法严重依赖于计算成本昂贵的下游评估,阻碍了系统分析和快速迭代。在这项工作中,我们通过对定义有效数字 DocID 的属性、指标和权衡进行全面研究来应对这一挑战。具体来说,我们的贡献有三个方面:首先,我们提出了一个统一的框架,将乘积量化(PQ)和残差量化(RQ)及其混合变体统一在一个设计空间内。这使我们能够系统地研究关键的 DocID 属性,例如层次结构与并行性,以及 DocID 长度和码本大小等超参数的影响。其次,我们定义了一套 无需训练(内在指标)来量化 DocID 质量并评估结构保真度,而无需完整模型训练的开销。通过在 MS MARCO 300K 和 NQ320K 上进行大量实验,我们分析了这些结构特性如何影响检索效果。