论文
Doc-REFRAG:重新思考多模式文档检索增强生成
Doc-REFRAG: Rethinking Multimodal Document Retrieval-Augmented Generation
摘要
现实世界的知识存在于多模态文档中,需要检索增强生成(RAG)才能准确回答问题。然而,现有的多模态 RAG 模型主要是针对单图像或封闭文档设置而设计的,在现实的多图像场景中表现出的准确性有限。此外,处理大量检索到的图像会因不相关的视觉标记而产生大量的计算开销。为了应对这些挑战,我们引入了 DocLongRAG,这是一个包含 343K 个问答对的大型数据集,每个问答对平均与 37.4 个检索到的图像相关联,以反映真实的 RAG 工作流程。在此数据集的基础上,我们提出了 Doc-REFRAG,这是一种问题引导框架,可将视觉标记压缩为粗块,并通过基于 RL 的轻量级选择器有选择地扩展与问题相关的标记。六个基准测试的实验表明,Doc-REFRAG 的性能优于十一个强大的基准,实现了最先进的精度,同时显着降低了推理延迟。我们的资源位于 https://github.com/Collab-Gen/Doc-REFRAG。