论文
自主测试修复的实际限制:LLM 驱动的发现和自我纠正的多代理案例研究
Practical Limits of Autonomous Test Repair: A Multi-Agent Case Study with LLM-Driven Discovery and Self-Correction
摘要
在大型企业应用程序中维护可靠的 UI 测试套件是一项持续且成本高昂的挑战。我们提出了一个多代理自主测试系统的工业案例研究,该系统使用来自类似生产的企业 UI 测试原型的匿名执行数据进行评估。该应用程序每个屏幕都有数百个动态 UI 元素。该系统建立在具有 LangGraph 编排、Playwright 执行和 RAG 知识库的 大语言模型 之上,从人工测试发展到高度自主的功能发现和测试执行:在没有明确的测试目标的情况下,它会在 10 个 UI 屏幕上发现 100 多个可测试功能,通过运行时 DOM 分析动态扩展额外的 15--30 个功能的覆盖范围,并迭代修复失败的测试,而无需人工干预。我们分析了 300 个连续的自主执行报告,其中包含 10 个不同场景系列中的 636 个单独的测试用例执行。系统在场景族级别实现了 70% 的修复收敛率,平均修复迭代 3.4 次即可收敛。然而,只有 10% 的场景系列在第一次尝试中成功,38% 的报告未能生成任何可执行的测试工件,并且我们记录了断言弱化和测试用例删除的具体实例,用作实现表面收敛的解决方法机制。我们的研究结果表明,不受限制的自主权会导致不稳定且常常具有误导性的结果,而受限的自主权则将此类系统转变为操作上可行的工作流程。我们的研究结果表明,企业规模环境中可靠的自主测试需要明确的约束、验证边界和人工监督,而不是提倡完全自主,以保持语义正确性和操作可信度。