论文

分离生成检索中的范式、标识符与解码

Disentangling Paradigm, Identifier, and Decoding in Generative Retrieval

上下文与知识检索增强

摘要

生成检索训练语言模型来生成相关文档的标识符。最近的工作用扩散取代了自回归解码器,但同时更改了标识符、训练配方和解码,因此差异不能归因于范式。在 NQ320K 和 MS300K 上,我们使用残差量化、乘积量化和随机标识符训练自回归、掩蔽扩散和块扩散模型。在标识符长度和训练预算固定的情况下,我们以多种方式解码每个模型。仅解码即可将扩散模型的 Hit@1 移动 6.6 到 13.7 点。我们的参考扩散解码、生成和匹配生成标识符,然后检索最接近的语料库标识符。生成的标识符适用于 14-21% 的 NQ320K 查询。我们测试一次性评分来解码扩散检索器:模型读取一次完全屏蔽的标识符,并且每个文档根据其代码的概率进行评分。它在 12 种设置中的 11 种中匹配或击败生成和匹配。自回归模型在 Hit@1 中仍然领先;在 NQ320K 上,领先来自模型,而不是波束搜索。从一个采样标识符开始,一次性评分消除了波束搜索中 46-83% 的掩模扩散缺陷;从生成和匹配,最多四分之一。在 NQ320K 上,每个范例很大程度上都会记住哪个标识符回答哪个查询:随机标识符保留剩余量化标识符的 Hit@1 的 83-90%。其中,乘积量化标识符在自回归模型中领先残差量化标识符 3.4 个点,在扩散模型中领先 -0.7 至 +3.6 个点;在解码过程中,AR 的差距比扩散的差距高出 1.5-2.3 个点,大约是我们的 2 点阈值。范式比较必须报告每个范式的配方和最佳解码。