论文

DragonCrawl:用于可扩展移动端对端测试的基于意图的生成框架

DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing

摘要

随着移动应用程序的复杂性不断增加,传统的端到端 (E2E) 测试框架面临着 UI 波动性、维护开销和跨平台可扩展性的困扰。本文介绍了 DragonCrawl,这是一种用于连续回归测试的人工智能驱动的移动测试系统,它已经从基于嵌入的相似性匹配发展到使用 大语言模型 的基于生成意图的推理。与之前基于 LLM 的专注于探索性测试和崩溃检测的测试研究不同,DragonCrawl 会验证每次代码更改的特定用户流程,阻止破坏关键功能的提交。通过利用 GPT-4o 的多模式功能,DragonCrawl 在 CI/CD 管道中连续运行的 1,013 项自动化测试中,在 iOS 上实现了 91.6% 的通过率,在 Android 上实现了 92.2% 的通过率。该系统将测试启动时间从 96-120 小时减少到 4 小时以下,并为开发人员节省了大约 27 年的测试维护工作。我们介绍了从 V1(语义嵌入匹配)到 V2(基于生成意图的推理)的架构演变,讨论了包括词元爆炸和内存限制在内的实施挑战,并报告了生产部署的操作经验。用于最终状态检测的多模态视觉与用于后端状态转换的工具调用的集成可实现全面的回归测试,从而桥接 UI 与系统状态的交互。我们的结果表明,人工智能驱动的测试可以保持稳定性,同时消除传统自动化测试的脆弱性,从而实现大规模的持续质量保证。