论文

ColGraphRAG:面向多模态GraphRAG的后期交互证据检索

ColGraphRAG: Late-Interaction Evidence Retrieval for Multimodal GraphRAG

上下文与知识检索增强

摘要

以图为底座的多模态问答把文本、表格与图像组织为结构化证据图,但端到端准确率取决于哪些多模态资产被排得足够高以进入下游推理;对图中关联的图像,单向量双编码器相似度会丢弃细粒度对齐所需的补丁级与token级结构。我们评估在保持离线图构建、文本与表格侧检索、结构化抽取和下游推理不变的前提下,把图中图像节点的视觉候选排序算子替换为ColBERT/ColPali谱系的后期交互MaxSim式多向量打分。在MultimodalQA上,这一改动与图中关联图像候选的检索阶段点估计提升及下游QA增益相关联,在视觉证据最重要的位置移动更大,在文本主导的问题上趋势混合;我们将这一模式解读为图中关联视觉证据纳入问题的机制层证据,同时指出更广的验证与更细的图级诊断仍是重要的后续工作。

ColGraphRAG:面向多模态GraphRAG的后期交互证据检索:论文配图
图 2:证据链接和基于图形的推理的说明性案例研究。对于询问哪项运动与 Ben Piazza 1976 年的电影相关的查询,κ⁡(q)=(cent,cτ,cvis)\kappa(q)=(c_{\mathrm{ent}},c_{\tau},c_{\mathrm{vis}}) 总结了实体、时间和视觉线索。时间线索 cτ=1976c_{\tau}=1976 引导表查找到电影实体 m⋆m^{\star},视觉分支检索关联的海报候选 p⋆εℐ⁡(m⋆)p^{\star}\in\mathcal{I}(m^{\star})。将选定的视觉证据转换为符号视觉线索 z⋆=ψ⁡(p⋆)z^{\star}=\psi(p^{\star})并插入到 Ge​(q)G_{e}(q) 中;扩展产生 G⋆​(q)G^{\star}(q) 用于生成答案。边rctxr_{\mathrm{ctx}}、rtabr_{\mathrm{tab}}、ryearr_{\mathrm{year}}和rimgr_{\mathrm{img}}表示上下文、表查找、时间和图像链接关系,仅用于说明证据路径。