论文
Baikal:面向数据湖深度研究的结构化搜索
Baikal: Structured Search for Deep Research over Data Lakes
摘要
数据湖上的深度研究要求LLM智能体跨数千张异构表格与大量段落调查证据,以综合成报告。现有方法进行迭代式检索与生成,让累积的上下文决定下一步调查什么,这可能导致过度挖掘局部有希望的线索,并在固定预算下无法覆盖不同的语义区域。为解决这一问题,我们将数据湖上的深度研究形式化为一个带预算的搜索问题,并提出Baikal——一个将异构证据聚类为语义区域、再在其上自适应搜索以平衡探索与利用的框架。在每个被选中的区域内,Baikal生成并调查基于该区域的子问题,以发现质量作为奖励来更新区域级价值估计,并在从随机与LLM引导选择到贝叶斯 $ε$-greedy 与 UCB 等多种策略下引导搜索。我们在HybridQA与TAT-QA数据湖上各以15个查询评估Baikal,两个数据湖分别包含10,993张和2,757张表格,并连同227K个Wikipedia段落与13K个财报段落。我们以一个涵盖有据性、相关性、多样性与实用性的新评分细则评估研究质量,并使用GPT-5-mini为Baikal及强基线打分,基线包括DeepSearcher以及带检索与聚类变体的OpenCode研究智能体。在两个数据湖上,Baikal在多种区域选择策略下均表现强劲;其最佳配置在HybridQA上将报告得分较最强基线提升28%,在TAT-QA上提升36%。我们的分析将这些增益归因于对语义证据区域的组织与探索,这提升了有据性与多样性,并在相同子问题预算下产生更有用的发现。这些结果证明了结构化语义探索对异构数据湖上系统性研究与发现的价值。