论文

LakeQuest:跨数据湖的基于证据的问答的三域基准

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

模型评测基准与评测资源

摘要

虽然现代问答 (QA) 系统在干净、模式一致的语料库上表现出色,但现实世界的知识很少如此整齐地打包。回答有关企业和科学数据湖的问题需要系统能够导航异构的、弱结构化的表格、段落和链接元数据集合。当前的基准测试抽象了这种嘈杂的发现过程,无法评估端到端性能。为了弥补这一差距,我们引入了 LakeQuest,这是一个由 9,846 个 QA 对组成的经过人工验证的基准,旨在评估现实数据湖上的端到端检索和合成管道。 LakeQuest 跨越三个不同的领域(AI/ML 元数据、零售银行业务和多模式生物医学药物信息),并将每个问题与精确的、模态感知的证据指针配对。通过将源发现与跨模式综合隔离,LakeQuest 暴露了现代 QA 系统中的关键故障模式。我们的基线评估,包括标准检索增强生成(RAG)和代理工具使用方法,表明高质量检索并不能保证正确的推理。系统始终与元数据图中的关系链、银行分类账中的策略与账目证据对应以及生物医学环境中的联合表格 QA 作斗争,这凸显了未来代理 QA 系统中对强大的发现和忠实的跨文件组合机制的需求。