论文
规范作为质量门:人工智能辅助代码审查的三个假设
The Specification as Quality Gate: Three Hypotheses on AI-Assisted Code Review
摘要
业界对人工智能生成的代码质量问题的主要反应是部署人工智能审核员。本文认为,当缺乏可执行规范时,这种响应在结构上是循环的:在没有外部参考的情况下,生成代理和审查代理都从相同的工件进行推理,共享相同的训练分布,并表现出相关的故障。审查根据代码本身检查代码,而不是根据意图检查代码。提出了三个假设。首先,同质 LLM 管道中的相关错误是相互呼应而不是抵消,这一说法得到了 2025-2026 年多项研究的汇聚经验证据以及此处报告的三个小型人为实验的支持。前两个实验是同族的(Claude 审查 Claude 生成的代码);第三个扩展到由来自三个系列的四个模型组成的跨系列面板。全部使用人工植入的错误语料库而不是自然缺陷样本;它们是定向证据,而不是受控演示。其次,可执行规范执行 Cynefin 意义上的域转换,将启用约束转换为治理约束,并将问题从复杂域转移到复杂域,人工智能使这种转变在经济上大规模可行。第三,位于可执行规范范围之外的缺陷类别形成明确定义的残差,这是人工智能审查的合法且有界的目标。综合论点暗示了一种架构:首先是规范,其次是确定性验证管道,仅针对结构和架构残差进行人工智能审查。这并不是说人工智能审查毫无价值。它是关于它的实际用途的声明,以及关于在没有使其成为非循环的基础的情况下部署它时会发生什么的声明。