论文
LLM 软件设计细化联盟:多代理协作拓扑的受控实验
LLM Consortium for Software Design Refinement: A Controlled Experiment on Multi-Agent Collaboration Topologies
摘要
我们提出了一项对照实验,评估用于软件架构设计的 12 个多代理 LLM 协作拓扑。使用 $2\times2\times2$ 因子设计(权威 $\times$ 角色 $\times$ 动态),我们在 8 个不同复杂度的设计任务中进行了 520 次实验运行,每个任务重复 5 次。由三个独立的自动评估器(GPT-OSS 120B、Claude Opus 4.6、Claude Sonnet 4.6)在 12 维标题上对设计进行评估。我们报告了四项核心发现。首先,结构对抗性(v4b)在整体上排名第一——一种即时设计的对抗性变体,需要重写命令而不是补丁(加权整体:4.637/5.0)。其次,跨模型审查一致获得第二名——用一个模型生成,用另一个模型审查——所有三个评估者排名第二(加权整体:4.606)。第三,评估者多样性本身就是一个发现——所有三个评估者都同意 v4b 最好,v3 最差,但对 v2b 意见分歧很大(Claude d=1.44 与 GPT-OSS d=0.45),揭示了不同模型系列如何权衡设计质量。第四,并行合并从根本上被破坏了——由于词元饥饿和弗兰肯斯坦效应,所有三个评估者都将合并变体放在底层(3.65-3.79)。加权整体($2\times$Opus + $2\times$Sonnet + $1\times$GPT-OSS)在 520 次运行中提供了稳健的排名,并通过独立交叉验证得到确认。