论文
ViDoRe V3:面向复杂现实场景的检索增强生成综合评测
ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios
摘要
检索增强生成(RAG)管线必须应对超越简单单文档检索的挑战,例如解读视觉元素(表格、图表、图像)、跨文档综合信息以及提供准确的来源扎根。现有基准未能捕捉这种复杂性,往往聚焦文本数据、单文档理解,或将检索与生成分开评测。我们提出ViDoRe v3,一个全面的多模态RAG基准,包含对视觉富文档语料的多类型查询。它覆盖10个跨多元专业领域的数据集,包含约26,000个文档页面,配以3,099个人工核验的查询,每种查询提供6种语言。通过12,000小时的人工标注投入,我们为检索相关性、边界框定位与核验过的参考答案提供了高质量标注。我们对最先进RAG管线的评测显示:视觉检索器优于文本检索器,晚期交互模型与文本重排序能大幅提升性能,混合或纯视觉上下文可提升答案生成质量。然而,当前模型在非文本元素、开放式查询与细粒度视觉扎根上仍然吃力。为推动应对这些挑战的进展,该基准以商业宽松许可发布于 https://hf.co/vidore。
