论文
VLD-RAG:代理视觉语言检索增强生成长的、视觉丰富的多页文档
VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents
摘要
报告、幻灯片和手册等视觉效果丰富的文档通常将回答问题所需的证据分布在多个页面上,将文本与布局提示、表格、图表和图形混合在一起。这项工作研究了多模态检索增强生成,用于对此类视觉丰富的长文档进行问答,其中检索必须选择包含文本和视觉信号的证据页面。我们提出了 VLD-RAG,一种代理多模式 RAG 框架,用于长文档的多页证据检索和跨页推理。 VLD-RAG 构建了一个页面保留多模态索引,用于存储解析的文本、页面级元数据和密集视觉表示,并使用混合检索策略,将基于关键字的稀疏搜索与密集语义查询相结合,以识别候选来源和证据页面。验证者引导的代理工作流程协调检索代理、应答代理和验证代理,以扩大证据覆盖范围、检测缺失的引文并在需要时优化检索请求。我们评估了 Top-1 和 Top-5 证据页面准确性的检索以及广义准确性的生成,并表明 VLD-RAG 在视觉丰富的长文档基准(包括 LongDocURL 和 MMLongBench-Doc)上改进了证据页面检索和最终任务问答,优于以前基于视觉的检索基线。这些发现强调,当正确答案依赖于分散在页面上的证据时,协调的代理验证和多模式混合检索对于可靠的基础至关重要。