论文
Sakana Fugu 技术报告
Sakana Fugu Technical Report
摘要
随着不同的提供商越来越专注于不同的领域,前沿 大语言模型 (LLM) 的功能不断进步。这就自然而然地提出了下一个目标:如何将各种 LLM 的各自专业结合到一个集体智能系统中。为此,我们报告了 Sakana Fugu 的开发,这是一系列协调器模型,可利用和增强 LLM 代理团队的能力。 Fugu 模型本身就是经过训练的语言模型,可以理解用户查询并动态设计代理支架来解决它们。通过这些自适应脚手架,Fugu 获得了超越任何单个 LLM 代理的性能,与其他可公开访问的模型相比,在一系列具有挑战性的任务中取得了最先进的结果,包括 SWE-Bench Pro、Terminal Bench、LiveCodeBench、GPQA-Diamond、Humanity's Last Exam 和 CharXiv Reasoning。我们发布了两种模型:Fugu,它在日常使用中平衡性能和延迟;Fugu-Ultra,它优先考虑最难问题的答案质量。我们描述了我们的训练范例,其中包括大规模 微调、进化算法和强化学习方法,以及将这些方法转化为生产系统的基础设施和核心设计原则。我们希望这份报告鼓励对多代理系统和动态、查询自适应代理支架的进一步研究,作为通向通过集体智慧访问的人工智能功能的下一个前沿的道路。