论文

Web2BigTable:面向互联网规模信息搜索与抽取的双层多智能体LLM系统

Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction

智能体系统上下文与知识记忆Agent 协作Agent记忆

摘要

智能体化网络搜索日益面临两种不同的需求:对单一目标的深度推理,以及对众多实体和异构源的结构化聚合。现有系统在这两方面都表现吃力。面向广度的任务要求输出符合模式对齐、覆盖面广且跨实体一致,而面向深度的任务需要在长而多分支的搜索轨迹上进行连贯推理。我们提出Web2BigTable,一个支持两种模式的“网页到表格”搜索多智能体框架。Web2BigTable采用双层架构:上层编排器将任务分解为子问题,下层工作智能体并行求解。通过闭环的“运行—验证—反思”过程,该框架借助持久且人类可读的外部记忆,随时间共同改进分解与执行,并对每个单智能体进行自进化更新。在执行过程中,工作智能体通过使部分发现彼此可见的共享工作区进行协调,从而减少冗余探索、调和相互矛盾的证据,并适应新出现的覆盖缺口。Web2BigTable在WideSearch上创造了新的最优水平:Avg@4成功率达38.50(为第二名5.10的7.5倍),Row F1为63.53(较第二名高25.03),Item F1为80.12(较第二名高14.42)。它还能泛化到XBench-DeepSearch上面向深度的搜索,取得73.0的准确率。代码发布于 https://github.com/web2bigtable/web2bigtable。

Web2BigTable:面向互联网规模信息搜索与抽取的双层多智能体LLM系统:论文配图
图 1:查询执行期间的 Web2BigTable 界面。左侧面板显示用户查询(左上),任务分解状态指示编排器已将查询划分为并行子任务(左下)。右侧面板以原始 Markdown 视图显示共享工作板内存,分为三个部分:跟踪每个工作人员的分配和完成状态的子任务清单、包含提取约束和目标模式的共享上下文块,以及每个工作人员将其结构化表输出写入专用标记分区区域的各个工作人员结果槽。