论文

小型大语言模型团队跨编排架构扩展的精确生成-转换分解

An Exact Generate - Transform Decomposition of Small-LLM Team Scaling Across Orchestration Architectures

智能体系统Agent 协作Agent Harness

摘要

用协作团队取代一名 LLM Agent可以提高准确性,但扩展团队是否有帮助以及扩展哪种架构尚不清楚。通过扫描 5 个指令调整的 7-9B 模型、5 个简答基准测试和最多 30 个调用的可执行代码基准测试的 8 个Agent编排架构,我们发现团队扩展的回报与任务密切相关:在两个算术单词问题基准测试(GSM8K、GSMHard)上,从 3 个到 30 个调用的准确度最多提高了 17 个点,但在 ARC、GPQA 和 MMLU 上最多提高了 4 个点,对于每种架构,准确度都比通常的架构高出 4 个点。任务平均数隐藏。 Proposer-Critic 捕获了算术收益,扩展最陡,总体而言,以最大预算(项目聚类间隔不包括零)超越了所有其他架构,尽管它在其他地方排名最弱,并且没有架构能够跨任务获胜。我们用精确的生成变换分解来解释这些轨迹。将任何工作流程划分为提案覆盖范围和下游转换,任何准确性更改都准确地分为广泛的覆盖红利和密集的转换更改。分解诊断每个任务:算术提供了评论家引导的变换转换的覆盖范围,而多项选择基准要么覆盖范围饱和,要么无法转换它,并且在开放式代码生成恢复上几乎消失,因此准确性跟踪覆盖范围。在相同的呼叫预算下,词元成本仍然相差 2.1 倍。因此,额外的调用创造了只有某些架构在某些任务上才能转换的候选机会。团队扩展是特定于任务和架构的赌注,而不是统一的杠杆。