论文
WideSeek-R1:经由多智能体强化学习探索面向广泛信息搜寻的宽度扩展
WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning
摘要
大语言模型(LLM)的最新进展主要聚焦深度扩展,即单个智能体以多轮推理与工具使用求解长程问题。然而,随着任务变得更宽,关键瓶颈从个体能力转向组织能力。在这项工作中,我们探索用多智能体系统实现宽度扩展这一互补维度,以应对广泛信息搜寻。现有多智能体系统往往依赖手工工作流与轮流交互,无法有效并行化工作。为弥合这一差距,我们提出WideSeek-R1,一个经由多智能体强化学习(MARL)训练的主智能体-子智能体框架,协同可扩展编排与并行执行。WideSeek-R1利用共享LLM并配合隔离上下文与专用工具,在20k个广泛信息搜寻任务的精选数据集上联合优化主智能体与并行子智能体。大量实验表明,WideSeek-R1-4B在WideSearch基准上取得40.0%的条目F1分数,与单智能体DeepSeek-R1-671B的表现相当。此外,WideSeek-R1-4B的性能随并行子智能体数量的增加而持续提升,凸显了宽度扩展的有效性。
