论文
ABTest:AI 行为驱动测试 编码智能体
ABTest: Behavior-Driven Testing for AI Coding Agents
摘要
AI 编码智能体 越来越多地集成到现实世界的软件开发工作流程中,但它们在多样化和对抗性场景下的稳健性仍然知之甚少。我们提出了 ABTest,一种行为驱动的模糊测试框架,它通过将现实世界的故障报告转化为基于存储库的行为测试来系统地测试 编码智能体。 ABTest(1)挖掘用户报告的异常,导出可重用的工作流模式(Interaction Patterns)和行为(Action types); (2) 将它们组成逐步模糊测试模板; (3) 在真实存储库中实例化可执行测试用例; (4) 使用 编码智能体 执行它们,同时记录痕迹和工件; (5) 检测并验证异常行为。我们将 ABTest 应用于三个广泛使用的 编码智能体:Claude Code、OpenAI Codex CLI 和 Gemini CLI。从 400 个用户报告的开发人员确认的代理故障中,我们提取了 47 种交互模式和 128 种操作类型,生成 647 个基于存储库的模糊测试案例。每个评估配置执行一次 647 例捆绑包,ABTest 标记了三个 编码智能体 系列的 1,573 个行为异常,其中 642 个被手动确认为新的真实异常,检测精度达到 40.8%。我们的结果表明,ABTest 有效地揭示了现实世界的故障,揭示了模型之间的鲁棒性差异,并揭示了以前未报告的故障模式。