论文

CHaystack:中文文档检索和 VQA 基准测试

CHaystack: Benchmarking Chinese Document Retrieval and VQA

模型评测基准与评测资源

摘要

检索增强生成(RAG)在扩展 大语言模型(LLM)的内存方面取得了实质性进展,最近的进展进一步推动 RAG 从纯文本设置走向多模态场景。在文档理解领域,文档视觉问答(DocumentVQA)已经从针对单个文档的问答发展到针对大规模文档集合的检索和生成管道。然而,目前还缺乏专门针对中文大规模文档检索和问答的基准测试。为了弥补这一差距,我们引入了CHaystack,这是一个新的中文DocumentVQA基准测试,涵盖四个文档类别,即学术论文、广告、网页和真实拍摄的文档,从而能够对DocumentVQA系统进行更全面的评估。此外,我们还提出了 CDocRAG,这是一个中文 DocumentVQA 系统,它使用基于 VLM 的相关性过滤器在答案生成之前验证检索到的文档图像。我们评估 CHaystack 上具有代表性的开源嵌入和生成模型。结果揭示了类别优势的明显对比:Qwen 系列模型在网页和论文等文本丰富的文档上表现最佳,而其他模型仅在广告等视觉丰富的类别上取得有竞争力的结果,并在文本密集的文档上急剧退化。对于检索,Qwen3-VL 达到 71.91 Recall@1,而最好的非 Qwen 模型仅达到 14.40。这些结果表明CHaystack的核心挑战在于中文文本编码,中文大规模DocumentVQA仍有很大的改进空间。我们的代码和日期集可在 https://github.com/hanxi19/CHaystack 上获取。