论文

人工智能辅助软件开发的治理方法层:缺陷分类、受控消融和流程超能力测试

A Governance Methodology Layer for AI-Assisted Software Development: Defect Taxonomy, Controlled Ablation, and a Test of Process-Over-Capability

智能体系统Agent 动作执行与治理

摘要

自主 编码智能体 生成可高速通过语法检查(编译、类型安全、CI)的输出。然而,语法正确性并不意味着语义正确性:设计边界、安全不变量和可维护性契约在结构上对于自动化管道来说仍然是不可见的。本文有四个贡献。首先,我们提出了一种基于五个人工智能代理许可和治理模块的缺陷类分类法,将通过静态分析在结构上可检测到的缺陷与需要语义审查的缺陷分开。其次,我们描述了一个运行时解耦的治理门——一种基于文件的协议,它读取生成器输出并发出结构化判决,无需 API 耦合,因此可以跨生成器移植。第三,我们将方法论形式化为代码:将验证协议表示为版本控制的可执行工件,其两层将可移植方法论与主机自动化分开。第四,我们报告了一个受控消融实验(E-ablation,N=5 工件,8 项独立的 真值),将工具结构化审查与词元匹配的非结构化提示进行比较。结构化条件记录下,宽松召回率为 62%,召回率为 50%,严格召回率为 25%,召回率为 0%。先前报告的严重程度等级差异无法通过盲目重新分级而被撤回(第 6.6 节)。盲评分的独立会话重新测试不会复制这种对比:条件的不同之处在于 24 中只有一次严格命中(6/24 对 5/24),结构化总计再次为 25%,非结构化 0% 不重复出现(第 6.7 节)。这两种情况都错过了人工 QA 审核员发现的文档质量缺陷,这表明结构化 AI 审核和人工流程检查之间具有互补性。重新测试并没有区分结构化审查和详细的非结构化提示,因此作为主导因素的流程设计仍然是一个假设,而不是本文的结果。