论文

UniRank:混合文本-图像候选者的端到端特定领域重新排名

UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates

摘要

重新排序是许多信息检索管道中的关键组成部分。尽管在纯文本设置方面取得了显着进展,但多模式重新排名仍然具有挑战性,特别是当候选集包含混合文本和图像项目时。一个关键的困难是模态差距:文本重排序本质上更接近文本候选而不是图像候选,从而导致有偏差和次优的跨模态排名。视觉语言模型(VLM)通过强大的跨模式对齐来缩小这一差距,并且最近已被用于构建多模式重新排序器。然而,大多数基于 VLM 的重新排序器将所有候选者编码为图像,并且将文本视为图像会带来大量的计算开销。与此同时,现有的开源多模式重排序器通常是在通用领域数据上进行训练的,并且在特定领域的场景中通常表现不佳。为了解决这些限制,我们提出了 UniRank,这是一种基于 VLM 的重新排名框架,可以对混合文本图像候选者进行本地评分和排序,而无需任何模态转换。在此混合评分接口的基础上,UniRank 提供了一个端到端的域适应管道,其中包括:(1) 指令调整阶段,通过将标签标记可能性映射到统一的标量分数来学习校准的跨模式相关性评分; (2)硬负驱动偏好对齐阶段,构建域内成对偏好,并通过人类反馈的强化学习(RLHF)执行查询级策略优化。对科学文献检索和设计专利检索的大量实验表明,UniRank 始终优于最先进的基线,将 Recall@1 分别提高了 8.9% 和 7.3%。