论文
LakeQA:针对百万级数据湖的探索性 QA 基准
LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake
摘要
最近的 大语言模型 (LLM) 在基于阅读的问答 (QA) 方面取得了快速进展,其中证据被明确提供或可以轻松检索。相比之下,现实世界的问题通常不会与准确的证据文件配对。有用的证据存在于海量的数据湖中,这使得搜索成为回答的先决条件。然而,缺乏需要对大型数据湖进行搜索和推理的综合基准。为此,我们引入了 LakeQA,这是一个在数据湖上以搜索为中心的问答的综合基准,共同强调搜索和推理能力。 LakeQA 建立在来自维基百科和开源政府数据的约 9.5 TB 文本资源的异构集合之上,涵盖结构化和非结构化数据。为保证任务质量,每个样本均由至少一名博士级专家进行注释。每项任务都需要具有隐式中间步骤的长视野多跳推理:代理需要发现正确的文档,然后跨源组合证据以产生答案。在七个前沿 LLM 上的实验结果表明 LakeQA 具有挑战性。例如,GPT-5.2 在 LakeQA 上仅获得 18.37% 的精确匹配分数。总的来说,LakeQA 为开发 LLM 代理提供了一个现实的测试平台,可以在现代数据湖中查找和分析数据。