论文

AI 编写代码的对抗性测试强化:仪器剖析和批评循环的预先注册因果估计

Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop

摘要

大语言模型 越来越多地编写代码和用于检查代码的测试;覆盖率记录运行的内容,而不是验证的内容。我们研究机械预言下的对抗性测试强化循环:测试者模型编写测试,变异测试命名幸存的注入缺陷,而批评者模型编写测试来准确消除这些缺陷,每个判决都是机械决定的,因此没有模型会判断另一个模型的输出。在实验 1 中,对 5 个 Python 受试者(无法对一个同谱系循环细胞进行评分),该循环杀死了 105 个突变体,一次性一代错过了这些突变体,并且没有丢失任何突变体,并且跨谱系批评问题返回了预先声明的 null。核心发现是尸检:早期的分析报告了 p = 9.5e-66 的跨谱系效应,这是一个仪器伪影,一个输出上限默默地截断了冗长的模型,只有通过对已完成的分析的对抗性审查才能发现。然后审查发现了一个更令人困惑的地方,每个手臂都重新采样了自己的初始套件;实验 2 将其删除。在预先注册的冻结共享轮 0 设计下(四个受试者各重复 5 次,提前提交种子),同系 Critic 轮杀死了冻结初始套件中 78% 的幸存者(平均增量杀死率 0.783,95% 集群引导间隔 [0.592, 0.935]),重复内因果估计;跨提供商配置显示出正的试点差异(速率差距 0.178,95% 区间 [0.039,0.347];大小由单个重复主导),臂成本低 5.5 倍。这比较了两个命名的模型-提供者-Harness配置,而不是孤立的沿袭效应:部分差距是一个配置收到的操作故障,包括截断重复,现在被检测到并评分,而不是被清洗。跨模型比较可以继承运行它们的Harness的不对称性。我们发布了两个协议、所有收据和分析代码。