论文
在合同中扎根人工智能代理:规范驱动测试生成的实证评估
Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation
摘要
基于 LLM 的代理越来越多地用于编码任务,它们的性能优于许多经典方法,并可扩展到存储库级别的任务,例如测试生成。然而,当直接提示生成测试时,这些代理可能无法推理代码及其底层契约,从而错过影响测试质量的边缘情况和行为边界。为了解决这个限制,我们提出规范驱动测试生成,我们指示代理首先推理并明确记录代码前置条件、后置条件和未定义的行为。这个中间半正式规范充当认知支架来指导后续测试的生成。我们对 Google 生产错误的评估表明,与传统的测试生成代理基线相比,规范驱动的代理可以将错误检测率提高 9.8 个百分点 ($p = 0.0352$),将分支覆盖率提高 2.5 个百分点 ($p = 0.0034$)。使用 LLM-as-a-Judge,我们进一步表明,由规范驱动代理生成的测试套件在 77.8% 和 56.7% 的情况下分别优于基线测试和人工编写的测试,并展示了在遵循最佳实践、可读性和边缘情况覆盖方面的改进。