论文
MM-BizRAG:重新思考通用企业问答的多模态检索增强生成
MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A
摘要
多模态检索增强生成 (MM-RAG) 的最新进展已转向最小化解析,依靠页面级图像来生成 检索器 嵌入和答案生成。虽然有效,但这种趋势往往忽略了对复杂企业文档中丰富的结构化信息的显式处理,而是依赖于预先训练的嵌入或视觉语言模型来隐式捕获此类结构。在这项工作中,我们采用了更直接的方法:MM-BizRAG 通过文档结构感知分割主动提取和表示文档结构,该分割通过特定方向的摄取管道动态路由文档,对垂直结构文档(例如报告)应用显式布局感知解析,对水平结构文档(例如幻灯片)应用整体页面级表示。统一的 LLM 驱动的工件转换管道具有基于占位符的位置对齐,可保留自然的阅读顺序,而推理时间多模态组装将检索表示与生成上下文分离,从而无需任何微调即可实现更丰富、更扎实的答案。通过对大型异构企业数据集和两个公共基准(SlideVQA 和 FinRAGBench-V)进行的实验,MM-BizRAG 始终比最先进的以视觉为中心的基准高出 32%,尤其是在报告式布局方面的表现尤其强劲。此外,我们还引入了 FastRAGEval,这是一种用于细粒度生成召回的单次调用 LLM Judge 指标,可将 RAGChecker 的成本减半,同时实现更强的人类对齐。