论文

跨数据库查询和网络搜索的混合深度研究基准测试

Benchmarking Hybrid Deep Research Across Database Querying and Web Search

智能体系统Agent任务评测

摘要

虽然自主代理通过迭代地浏览开放网络来合成信息,在“深度研究”方面取得了重大进展,但现实世界的问题解决很少局限于单一环境。复杂的分析任务本质上要求代理将来自模糊的非结构化文本(例如开放网络)和高度精确的结构化数据(例如关系数据库)的证据编织在一起。然而,现有的基准测试是孤立地评估这些模式的,未能捕捉到关键的“切换”——在系统之间移动证据时保留约束的能力。我们推出了 HybridDeepResearch,据我们所知,这是第一个深度研究基准,需要网络搜索和 SQL 才能形成完整的、可验证的答案。该基准测试包含 380 个基于 LiveSQLBench-Base-Lite 数据库和公共网络语料库的工具相关任务,通过自动检查和人工审核进行验证,并涵盖三种推理模式:SQL2S、S2SQL 和并行。在各种代理支架下对专有模型和开放权重模型的评估表明,即使是最先进的模型,如 GLM-5.2、Claude-Sonnet-4.6 和 GPT-5,在硬子集上也只能达到约 50-54% Pass@8。值得注意的是,结果表明,定向推理比并行交叉要困难得多,这突显出在不失去约束的情况下桥接结构化和非结构化信息空间仍然是代理系统面临的主要挑战。代码和数据集可在 GitHub (https://github.com/Snowflake-AI-Research/HybridDeepResearch) 和 Hugging Face (https://huggingface.co/datasets/Snowflake/HybridDeepResearch) 上公开获取。