论文
将协调模式作为一等公民的从零多智能体编程实证研究
An Empirical Study of Coordination Mode as the First-Class Citizen in From-Scratch Multi-Agent Coding
摘要
多智能体氛围编程(vibe coding)有望加速软件开发,但现有基准依赖合成环境,忽视实际的时间与金钱成本,将推理与通信混为一谈,且只奖励表面上的完成。我们提出从零开始的多智能体评估基准MSEval,在真实世界任务上评估多智能体编程。MSEval扎根于横跨10个领域的10个真实全栈项目,使用分层需求与确定性评分细则为性能打分。其执行引擎LegoGent测试10种协作拓扑,其中智能体通过周期性同步间隔进行协调,并通过原生CI/CD流水线部署。与此同时,自动评分器TAgent动态探测实现,联合度量功能成功、延迟与前缀缓存token成本。在100次运行中,MSEval揭示组织拓扑在塑造速度-成本-质量权衡方面可与模型能力比肩。对于相同的任务与模型,改变拓扑可使分数波动超过30分,并使墙钟时间翻倍。结构化流水线收敛最快且质量最高,而繁重的管理监督会降低性能。最终,MSEval为度量多智能体团队如何实际构建软件建立了严格且可复现的标准。该基准已发布于 https://github.com/robinren03/MSEval。
