论文
区分AI生成代码与Agentic修复的DevOps仿真评测
How AI Changes DevOps Performance: A Mechanism-Based Simulation
摘要
背景:AI软件开发工具从代码补全发展到自主Agent,但其对DORA表现的证据混杂,多为横截面研究,也常把AI生成代码(AGC)与Agentic AI(AGT)混为一谈。目标:分别及联合考察AGC和AGT如何影响部署频率、交付前置时间、变更失败率、恢复时间及部署返工率。方法:审计证据,形式化包含四项能力调节因素的双构念模型,实施交付流水线离散事件仿真。六项实验包括因子设计、Shapley分解、600组参数抽样敏感性分析、固定需求鲁棒性测试,以及具有反事实的5000个模拟团队错峰采用面板。结果:两种能力配置下,AGC均提高失败率、返工和恢复时间。当AI增加变更量时,AGC仅在审查容量有余裕时缩短前置时间13%,审查饱和后反而延长;低能力团队的部署频率增长全部来自非计划返工。AGT提高部署频率31%至34%,缩短前置时间8%至22%、恢复时间29%至38%,但稳定性效果依赖自主CI修复掩盖缺陷;高能力团队的逃逸缺陷增加。能力降低AGC绝对失败率惩罚,从7.9到1.5个百分点,却不降低相对惩罚,分别为34%与84%。双向固定效应低估采用效果8%至16%;检测模型中的稳定性效果约需50个团队,检测能力调节约需400个。结论:在模型内部,DORA指标通过排队、批量处理和监督响应AI,不仅取决于代码质量。我们推导测量规则、Agentic修复护栏与基于样本规模的实地验证协议。