论文
通过前缀保留优化缩小多模态生成检索中的索引-解码差距
Closing the Indexing-Decoding Gap in Multimodal Generative Retrieval via Prefix Retention Optimization
摘要
多模态生成检索将多模态检索制定为离散标识符生成,从而消除了对外部嵌入进行显式相似性搜索的需要。现有方法通过残差量化构造标识符,并使用特里约束波束搜索对其进行解码。这种组合引入了索引-解码差距:标识符学习目标,包括重建和对比损失,在解码过程中没有明确强制前缀可辨别性。因此,即使是优化良好的标识符也可能由于低秩前缀而在波束搜索的早期被不可逆地修剪。我们从理论上描述了这一差距,并得出了一个生存界限,将前缀保留与索引和解码中的三个可控因素联系起来。在此界限的基础上,我们提出了 PRO(前缀保留优化),这是一个包含三种机制的统一框架:(i)前缀排名 蒸馏 将量化前缀排名与使用列表损失的预量化嵌入引起的排名对齐; (ii) 词汇调度将码本大小从浅到深的残差量化级别增加,以减少来自非目标前缀的早期竞争; (iii)几何得分融合向量化每个候选前缀并将其与查询的相似性纳入波束搜索评分,进一步减少索引-解码不匹配。对九个多模态检索任务的实验表明,PRO 提高了目标标识符前缀的保留,并且优于现有的多模态生成检索基线。