论文
迷失在解码中?生成检索中的前瞻先验的再现和压力测试
Lost in Decoding? Reproducing and Stress-Testing the Look-Ahead Prior in Generative Retrieval
摘要
生成检索(GR)通过自回归生成文档标识符对文档进行排名。由于许多 GR 方法依赖于 trie 约束波束搜索,因此它们很容易受到有限波束解码下相关前缀的早期修剪的影响。生成检索中的提前规划 (PAG) 通过使用同步解码来计算指导后续顺序解码的文档级先行预测,从而缓解了这种故障模式。我们在推理时重现 PAG 并对其解码行为进行压力测试。使用作者在报告的解码设置下发布的检查点和标识符/特里结构工件,我们重现了 MS MARCO Dev 和 TREC-DL 2019/2020 上的主要有效性结果,并在我们的硬件设置中证实了报告的波束大小延迟权衡。除了再现之外,我们还引入了计划漂移诊断,该诊断可以量化意图保留查询变化如何改变规划器的前 n 个候选集和最高权重的规划器标记,以及这些变化如何影响引导解码。我们发现 PAG 的规划信号在词汇表面形式变化下很脆弱:意图保留的拼写错误可能会引发计划崩溃,其中计划的候选池发生足够的变化,以至于前瞻奖励几乎无法提供有用的指导,从而有效地将解码恢复到较弱的无引导搜索。我们使用非英语 mMARCO 查询针对英语索引进一步评估固定索引跨语言稳健性,并评估不需要重新索引的查询端缓解策略;查询翻译在我们的设置中提供了最强的恢复。总体而言,我们的结果证实了 PAG 报告的有效性以及在已发布的推理设置下规划引导解码的优势,同时表明这些收益取决于实际查询变化和查询文档不匹配下规划信号的稳定性。