论文
面向医学问答的迭代式多模态检索增强生成
Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering
摘要
医学检索增强生成(RAG)系统通常在从生物医学文献中提取的文本块上运行,丢弃了原始文档页面中丰富的视觉内容(表格、插图、结构化版式)。我们提出MED-VRAG,一个迭代式多模态RAG框架,直接在PMC文档页面图像而非OCR文本上进行检索和推理。该系统将ColQwen2.5的patch级页面嵌入与分片MapReduce LLM过滤器相结合,可扩展至约350K页,同时借助离线由粗到细索引(每页C=8个质心、在质心上做ANN、对top-R候选列表做精确双向评分)将第一阶段检索保持在30毫秒以内。视觉语言模型(VLM)随后在最多3轮推理中迭代精炼查询并在记忆库中累积证据,单轮迭代约耗时15.9秒,在4xA100上完整的三轮流水线约47.8秒。在四个医学问答基准(MedQA、MedMCQA、PubMedQA、MMLU-Med)上,MED-VRAG达到78.6%的平均准确率。在使用相同Qwen2.5-VL-32B骨干的受控比较中,检索相比无检索基线贡献了+5.8个百分点的提升;相比MedRAG + GPT-4(76.8%)也有+1.8个百分点的优势,但需注意这是跨论文而非同台比较。消融实验分离出:页面图像检索相比文本块检索贡献+1.0,迭代贡献+1.5,记忆库贡献+1.0。
