论文

比较 Vibe 编码工具生成的代码质量

Comparing the Quality of Code Generated by Vibe Coding Tools

智能体系统Agent任务评测

摘要

使用人工智能代理自动生成代码在软件开发中已经变得越来越普遍。然而,生成代码的质量仍然令人担忧,包括可维护性、可读性和长期演化方面。本研究比较了三种广泛采用的 vivi 编码工具(Lovable、v0 和 Replit)从单个生成提示开始生成的代码的结构质量。我们为每个工具生成三个独立的项目,总共九个 Web 应用程序,并将它们提交到 SonarQube 进行静态分析。我们收集问题数量、严重性分布、估计的修复工作、圈数和认知复杂性以及代码重复等指标。初步结果表明,这些工具表现出不同的定性特征:Lovable 集中了严重性较低的问题,但每个 KLOC 的代码异味密度明显更高,而 v0 和 Replit 则生成更多具有更严重严重性特征的代码。这些发现表明,在氛围编码工具之间进行选择涉及到超出感知生产力的结构性权衡。