论文
WIDE:具有动态扩展的通配符推理用于跨模态生成检索
WIDE: Wildcard Inference with Dynamic Expansion for Cross-Modal Generative Retrieval
摘要
通过将表示学习和搜索统一到单个序列到序列生成任务中,生成检索已经取得了巨大的成功。然而,将这种范式扩展到跨模态检索揭示了由于不同模态之间固有的信息不对称而产生的关键挑战,例如简洁的文本查询和密集的视觉候选之间的差距。这种结构不匹配导致自回归解码器在通过标准特里约束波束搜索生成标识符时遭受强制幻觉,其中模型因无法猜测查询中缺少的细粒度细节而受到严重惩罚,从而允许不相关的候选者劫持最高排名。为了解决这个问题,我们提出了动态扩展通配符推理(WIDE)。 WIDE 采用自适应熵阈值 (AET) 来离线校准特定于层的不确定性边界。在解码生成阶段,不对称感知通配符解码 (AWD) 会检测语义盲点并发出通配符而不是强制确定性标识符,从而动态扩展搜索空间,而不会产生对数概率损失。最后,盲点重排序(BSR)使用将离散生成置信度与连续语义相似性相结合的混合评分机制来评估扩展的候选池。 M-BEIR 基准的大量实验表明,WIDE 的性能优于最先进的生成检索方法,有效抑制强迫幻觉,同时保持紧凑的索引结构。