论文
ColGraphRAG:面向多模态GraphRAG的后期交互证据检索
ColGraphRAG: Late-Interaction Evidence Retrieval for Multimodal GraphRAG
摘要
以图为底座的多模态问答把文本、表格与图像组织为结构化证据图,但端到端准确率取决于哪些多模态资产被排得足够高以进入下游推理;对图中关联的图像,单向量双编码器相似度会丢弃细粒度对齐所需的补丁级与token级结构。我们评估在保持离线图构建、文本与表格侧检索、结构化抽取和下游推理不变的前提下,把图中图像节点的视觉候选排序算子替换为ColBERT/ColPali谱系的后期交互MaxSim式多向量打分。在MultimodalQA上,这一改动与图中关联图像候选的检索阶段点估计提升及下游QA增益相关联,在视觉证据最重要的位置移动更大,在文本主导的问题上趋势混合;我们将这一模式解读为图中关联视觉证据纳入问题的机制层证据,同时指出更广的验证与更细的图级诊断仍是重要的后续工作。
