论文
编码智能体 的架构作为能力均衡器
Architecture as Capability Equalizer for Coding Agents
摘要
基于 LLM 的 编码智能体 从高级描述生成完整的软件系统,但人们对架构规范的格式如何影响生成代码的质量或这种影响是否取决于模型能力知之甚少。我们提出了一项对照实验,比较来自三个供应商系列(Anthropic Claude、OpenAI GPT、Google Gemini)的六个模型的五种信息等效规范格式(非正式散文、带有约束和 ADR 的美人鱼图、OpenAPI、C4/Structurizr DSL 和带有 ArchUnit 风格规则的 TypeScript 接口契约)。在 90 轮多轮代理试验中,规范格式显示出强大的格式 x 模型交互作用。在最强的模型(Sonnet 4.6、GPT-5)上,格式几乎不重要(质量分布 0.17-0.92)。在较弱的模型上,格式产生 0.83-2.42 点的差距,代码近似格式(OpenAPI、TypeScript 合约)弥补了大部分能力差距。当中间层模型进入更强模型所避免的编译调试循环时,它们可能会比前沿模型消耗更多的词元,从而产生更差的输出。在整个能力范围内,自我验证率从 100%(Sonnet)下降到 0%(Gemini Flash)。 TypeScript 将最弱模型的 API 路由覆盖率提高了三倍(33% 到 100%)。结构化架构规范充当能力均衡器,其价值与模型强度成反比,并为成本优化部署带来最大回报。