论文

LITTA:基于视觉的多模态检索的后期交互和测试时间对齐

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

上下文与知识检索增强

摘要

由于上下文较长、布局复杂以及用户问题和支持页面之间的词汇重叠较弱,从教科书、技术报告和手册等视觉效果丰富的文档中检索相关证据具有挑战性。我们提出了 LITTA,一种以查询扩展为中心的证据页面检索检索框架,可改进多模式文档检索,而无需 检索器 重新训练。给定用户查询,LITTA 使用 大语言模型 生成互补查询变体,并使用带有后期交互评分的冻结视觉 检索器 检索每个变体的候选页面。然后,通过倒数排序融合来聚合来自扩展查询的候选者,以提高证据覆盖范围并降低对任何单个短语的敏感性。这种简单的测试时策略显着提高了检索的鲁棒性,同时保持与现有多模态嵌入索引的兼容性。我们在计算机科学、制药和工业手册三个领域的基于视觉的文档检索任务上评估 LITTA。与单查询检索相比,多查询检索始终如一地提高了 top-k 准确率、召回率和 MRR,在具有高视觉和语义可变性的领域中收益尤其大。此外,准确性与效率的权衡可以通过查询变体的数量直接控制,这使得 LITTA 适合在延迟限制下进行部署。这些结果表明,查询扩展为改进基于视觉的多模态检索提供了一种简单而有效的机制。