论文

使用开源 SLM 进行科学文档理解的多模态混合检索增强生成

Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs

上下文与知识检索增强

摘要

在没有事先 微调 的情况下回答科学文献中特定领域的问题时,大语言模型 往往会产生幻觉。目前,诸如检索增强生成之类的方法部分解决了这个问题,但面临着不同的挑战:有限的上下文知识、稀疏和密集检索之间的差异以及检索噪声。本文提出了一种先进的多模态检索增强生成系统,旨在解决这些挑战并提高信息提取的准确性。所提出的架构引入了多模式摄取管道,该管道利用开源视觉语言模型(Qwen2-VL-2B-Instruct)来生成表格和图形的文本摘要。检索阶段将基于 HNSW 的语义搜索与基于 GIN 的词汇搜索集成在一起,通过倒数排名融合进行统一,并使用交叉编码器重新排名进行细化,以最大限度地减少检索噪声。为了确保多轮交互中的对话一致性,采用了查询压缩器模块。评估是通过使用 MMLongBench 基准、BeIR 格式的合成数据集和 DeepEval 框架独立评估摄取、检索和生成阶段来进行的。此外,结果表明,与 Naive-RAG 基线相比,检索质量提高了 157%,延迟仅增加 50 毫秒,而 Qwen2-VL-2B-Instruct 的结果可与 BERTScore 中基于云的模型相媲美。这些发现证明,开源优化的 SLM 与高级检索策略相结合,可以在不依赖基于云的模型的情况下为文档理解提供有竞争力的性能。