论文

多模态 CoLRAG-TF:复杂 PDF 的三重过滤检索

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

上下文与知识检索增强

摘要

由于多模式内容、特定领域术语以及跨分散证据进行多跳推理的需要,异构 PDF 集合上的检索增强生成 (RAG) 仍然具有挑战性。我们提出了多模态 CoLRAG-TF,这是一种四轴融合架构,集成了密集文本嵌入、BM25 关键字匹配、知识图三重过滤和基于图像的相似性,用于对复杂文档进行鲁棒检索。我们的系统构建了从 43 个日本灾难教训 PDF 中提取的 2,403 个块的多模态索引,并由混合 OCR 管道和基于 LLM 的图像描述生成提供支持。为了增强组合推理,我们提取了 11,414 个 OpenIE 三元组并使用 FAISS 对其进行索引,从而实现亚秒级三元组查找和相关信号的分层传播。受 HippoRAG2 启发的从粗到细的 检索器(卷 $\to$ 章节 $\to$ 块)在最终融合评分之前缩小了搜索空间。对融合权重的贝叶斯优化表明,三轴必须占主导地位 ($α_\text{triple} = 0.44$),以抵消词汇偏差并维持多跳检索质量。在 457 对基准上进行评估,多模态 CoLRAG-TF 的检索召回率为 0.9909,多跳答案相似度比单跳查询提高了 71.6$\%$。使用视觉 LLM 的图像到课程管道进一步证明了该方法对视觉输入的适用性。这些结果表明,三重过滤多模态融合对于噪声、异构 PDF 的结构化推理至关重要,并提供了适用于灾难领域之外的通用框架。