论文

ViDoRe V3:面向复杂现实场景的检索增强生成综合评测

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

模型评测基准与评测资源

摘要

检索增强生成(RAG)管线必须应对超越简单单文档检索的挑战,例如解读视觉元素(表格、图表、图像)、跨文档综合信息以及提供准确的来源扎根。现有基准未能捕捉这种复杂性,往往聚焦文本数据、单文档理解,或将检索与生成分开评测。我们提出ViDoRe v3,一个全面的多模态RAG基准,包含对视觉富文档语料的多类型查询。它覆盖10个跨多元专业领域的数据集,包含约26,000个文档页面,配以3,099个人工核验的查询,每种查询提供6种语言。通过12,000小时的人工标注投入,我们为检索相关性、边界框定位与核验过的参考答案提供了高质量标注。我们对最先进RAG管线的评测显示:视觉检索器优于文本检索器,晚期交互模型与文本重排序能大幅提升性能,混合或纯视觉上下文可提升答案生成质量。然而,当前模型在非文本元素、开放式查询与细粒度视觉扎根上仍然吃力。为推动应对这些挑战的进展,该基准以商业宽松许可发布于 https://hf.co/vidore。

ViDoRe V3:面向复杂现实场景的检索增强生成综合评测
图2:基准创建过程总览。查询来自 3 个来源:人工抽取式(human extractive,使用原始页面)、人工盲上下文式(human blind contextual,使用摘要以缓解抽取偏差)与合成盲上下文式(synthetic blind contextual)。对每个查询,由 1–3 名人工标注者对经 VLM 预筛选的候选页面子集进行标注,执行相关性打分、边界框定位与答案生成。最后的响应聚合将各标注者的答案合并为单一答案。