论文
超越测试存在:评估开源项目中代理生成的测试的质量和稳健性
Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects
摘要
将人工智能驱动的 编码智能体 集成到持续集成/持续交付 (CI/CD) 管道中从根本上改变了软件验证的执行方式。虽然这些代理成功地自动化了测试生成,但当前的评估基准(例如 SWE-bench)主要关注通过率而不是生成的测试的内在质量。这提出了“隐形技术债务”的可能性,其中测试套件通过执行但不提供全面的覆盖范围或语义价值。我们通过对 204,673 个测试工件(其中包括 24,941 个人类编写的文件和 179,732 个代理生成的文件)进行大规模的实证比较来解决这一方法论差距;源自 AIDev 数据集。使用抽象语法树 (AST) 解析和 Python 的朴素 ast 模块,我们实现了一个“白盒”静态分析框架来评估三个质量维度:断言强度 (RQ1)、边缘情况覆盖 (RQ2) 和脆弱性潜力 (RQ3)。我们的结果呈现出传统假设的微妙反转。尽管人类开发人员在断言强度方面稍有优势(强断言为 88.1%,代理为 85.37%),但在边缘情况覆盖率方面,人工智能代理的表现比人类更好,边界检查的种类几乎是人类的两倍(品种得分:0.62 比 0.32),空安全测试的频率更高(13.40% 比 8.3%)。但这种彻底性是有代价的:由于主要依赖于文件 I/O 和非确定性逻辑,代理生成的测试表现出较高的不稳定风险(候选率:0.41 与 0.30)。这些发现表明,虽然人工智能代理擅长严格的边界测试,但它们缺乏编写稳定、密封测试所需的“环境意识”。