论文
少即是多:通过多信号后期融合实现无图多模态 RAG
Less Is More: Graph-free Multimodal RAG via Multi-signal Late Fusion
摘要
基于图的检索增强生成(RAG)广泛用于多模式、跨文档问答。然而,构建语料库级别的图成本高昂、查询速度慢且难以维护。我们提出了 TrioRAG,一种无图多模态框架,它集成了来自三个互补信号的证据:问题、锚定图像以及从两者生成的 VLM 增强查询。每个信号通过页面文本和页面图像的共享多向量索引独立检索,并通过后期融合组合结果。此外,我们还介绍了 AutoQA,这是一种多模式汽车基准测试,其问题基于嘈杂的网络来源图像,而不是干净的文档来源数据。它的问题需要跨手册进行推理。我们将其定位为模型策划的测试平台,而不是经过人类验证的黄金标准。在三个基准测试中,TrioRAG 匹配或优于基于图的系统,同时降低了总成本并将每个查询推理速度提高了 1.6-2.3 倍。通过构建,AutoQA 将其问题基于语料库外的网络图像。在此设置中,图像检索仅达到 19.3% 的文档级召回率,而文本衍生信号,尤其是 VLM 增强的查询,保持检索的稳健性。