论文

DiffRetriever:使用扩散语言模型进行检索的并行代表词元

DiffRetriever: Parallel Representative Tokens for Retrieval with Diffusion Language Models

上下文与知识检索增强

摘要

本文展示了如何将扩散语言模型 (DLM) 用作有效且高效的 检索器。现有的基于 DLM 的 检索器(例如 DiffEmbed)遵循 BERT 式编码,将每个查询或段落表示为单个均值池向量。这忽略了如何训练 DLM 在双向注意力下通过屏蔽位置预测生成响应,这种能力可以提供更强的检索信号。我们提出了 DiffRetriever,它直接使用 DLM 的本机屏蔽位置预测进行检索。对于每个查询或段落,DiffRetriever 附加一个或多个屏蔽位置,使用输出作为单个正向传递中的检索表示。凭借一个屏蔽位置,单表示 DiffRetriever 已经在相同主干上比 DiffEmbed 有所改进。 DiffRetriever 还自然地扩展到多表示检索:DLM 联合处理多个屏蔽位置,从而实现 ColBERT 式的细粒度匹配,而几乎没有额外的编码延迟。在自回归 LLM 检索器 中,相同的多重表示策略需要顺序解码,因此会产生更高的延迟。在我们的匹配比较中,DiffRetriever 获得了最强的总体有效性,优于 DiffEmbed、PromptReps 和 RepLLaMA。在训练数据上选择的掩码位置计数可以很好地跨数据集传输,而每个查询的变化表明自适应分配的空间。代码可在 https://github.com/ielab/diffretriever 获取。