论文

生成架构如何塑造多代理 LLM 系统中的代码复杂性:HumanEval 的配对研究

How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval

智能体系统Agent任务评测

摘要

大型语言模型代码生成已从单次提示转变为多代理编排(分析师、编码器、测试人员和调试器管道),并且几乎完全根据功能正确性进行评估。这些架构是否也会影响它们生成的代码的结构复杂性,以及哪些编排层承担成本,在很大程度上仍然没有得到检验:之前的工作已经记录了对代码复杂性的提示级影响,但架构级问题是开放的。我们使用五个 RADON 复杂性指标(SLOC、圈复杂度和 Halstead Volume、Difficulty 和 Effort),在 GPT-4o 系列的两个模型下,对所有 164 个 HumanEval 任务(1,968 个配对观察)中的六种广泛使用的多代理配置(Basic、AC、ACT、Debugger、AC+Debugger、ACT+Debugger)进行比较。我们在所有完成和仅通过条件下应用配对非参数统计管道(Friedman 综合、带有 Holm 校正的 Wilcoxon 符号秩事后、Kendall 的 $W$ 和匹配对秩双列效应大小)。这六种架构分解为两个无法区分的复杂性集群,其间隔为 50-130%,两个模型和两种条件下的划分相同;在架构层中,分析人员与编码人员的分离会增加复杂性,而运行时调试器不会增加复杂性,并且在分析人员与编码人员的背景下会主动减少复杂性,而测试人员会重新增加复杂性。重型集群的额外复杂性并不能带来 pass@1 优势:最精简的架构在准确度上可以匹配或击败最重型的架构。因此,LLM 代码生成中的架构阐述应该通过在重要维度上测量的收益来证明其合理性,而不是假设。