论文

软件工程的氛围转变:评估人工智能主导的对话式编程的性能、认知和负责任的采用

The Vibe Shift in Software Engineering: Evaluating AI-Led Conversational Programming for Performance, Cognition, and Responsible Adoption

模型评测模型能力评测

摘要

本研究评估了 Vibe Coding,这是一种新兴的 AI 主导的对话式编程范式,使开发人员能够通过与 大语言模型 的自然语言交互来生成软件。该研究采用混合方法设计,与传统和人工智能辅助编码环境相比,评估了性能效率、认知影响和负责任的采用。包括专业开发人员和高级计算学生在内的 30 名参与者在三种实验条件下完成了同等的编程任务。使用描述性统计和重复测量方差分析来分析定量数据,同时通过主题分析来检查定性数据。结果表明,vibe编码显着提高了开发效率,与传统编码相比,任务完成时间缩短了27%,与人工智能辅助编码相比,任务完成时间缩短了12%。然而,这些收益伴随着较低的可维护性指数和较高的安全漏洞,表明软件质量的权衡。可用性结果获得了良好的评级(SUS = 71.4),而认知工作量仍然中等(NASA-TLX = 55.5),反映出句法工作量减少,但语言推理增加。主题分析将信任校准、失控、认知适应和即时工程策略确定为关键结构。值得注意的是,由于人工智能生成的输出的透明度和验证降低,感知到的失控与安全风险增加相关。基于这些发现,该研究提出了一个负责任采用的三大支柱框架:人类和人工智能能力的混合集成、人类监督和透明的问责制以及情境感知部署。总的来说,vibe 编码提高了生产力,但需要严格的监督,从而加强了其作为软件开发中变革性和过渡性范式的作用。