论文
SearchSwarm:面向长程深度研究的智能体LLM委派智能
SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
摘要
人们越来越期望大型语言模型能够处理复杂的、长期的现实世界任务,这些任务的上下文需求可以无限制地增长,但模型上下文窗口本质上仍然是有限的。最近的工作探索了一种范例,其中主代理分解任务并将子任务分派给子代理,子代理执行并仅返回汇总结果,从而节省主代理的上下文预算。然而,要做好这一点需要委派智能:能够分解复杂的任务,确定委派的时间和内容,并将返回的结果集成到正在进行的工作流程中。这种能力的训练数据在自然存在的文本中很少见,而且据我们所知,如何合成这些数据并训练模型来获得这种能力在开源社区中很大程度上仍未得到探索。为了弥补这一差距,我们提出了一项针对深度研究的初步探索,这是一项具有代表性的长期代理任务。具体来说,我们设计了一个工具,引导模型进行高质量的任务分解和委派,同时限制子代理正确返回结果以支持主代理的工作流程。Harness引导的轨迹自然地编码了正确的委托决策,我们将其用作监督微调数据,将委托智能内化到模型权重中。我们的最终模型 SearchSwarm-30B-A3B 在 BrowseComp 上获得 68.1 的成绩,在 BrowseComp-ZH 上获得 73.3 的成绩,是所有同等规模模型中的最佳成绩。我们将发布我们的工具、模型权重和训练数据,以促进未来的研究。
