论文
GTDD:面向AI编码智能体的生成式测试驱动开发
GTDD: Generative Test-Driven Development for AI Coding Agents with Adversarial Testing
摘要
测试驱动开发给AI编码智能体实现软件的可执行需求。但这些智能体会把实现适配到它们观察到的示例上——通过预定测试集可能留下大量预期行为未实现。我们提出生成式测试驱动开发(GTDD):TDD的一种形式化,其中独立的测试智能体在每个候选实现定型后,依人工指定的行为契约与先前轮次的反馈生成新输入;受信评估器检查这些输入、向编码智能体返回精简反例并存为回归测试,使开发不断面对超出初始示例的失败。我们经由自适应候选选择下假接受的有限总体分析刻画该过程提供的证据:所得界量化测试可见性与重复反馈如何影响接受,并显示候选提交后的新鲜随机审计可跨开发轮次控制假接受。在有状态键值存储上的配对实验中,开发期间再生成测试的两个策略最终平均失败率都低于由同一语言模型一次性生成测试的策略;把候选源交给测试者未带来可检测的额外改善;要求等量测试的进一步条件没有把差异来源孤立到任何单一特性。GTDD把这种自适应开发反馈与既定回归测试及独立验收规则结合。