论文

GUITestScape:探索性 GUI 测试的开放式评估

GUITestScape: Towards Open-set Evaluation on Exploratory GUI Testing

智能体系统Agent任务评测

摘要

探索性 GUI 测试对于 MLLM 代理来说是一项要求特别高的设置:如果没有预定义的测试脚本,代理必须自主导航应用程序并通过其自身的交互发现缺陷。然而,目前的评估在两个方面存在不足。首先,现有的基准测试几乎只关注交互缺陷,而将显示缺陷排除在评估框架之外。其次,评估协议与预定义的缺陷注释绑定在一起,将测试过程分解为单一的最终状态判断,该判断合并了质量上不同的故障模式。为了应对这些挑战,我们推出了 GUITestScape,这是一个交互式基准测试,涵盖 61 个现实世界的 Android 应用程序和 508 个跨越交互和显示类型的预设缺陷,并引入了 GUIJudge,这是一个开放集评估器,可将代理的测试轨迹分解为独立可诊断的功能。实验结果表明,GUIJudge 实现了超出预定义注释的可靠的流程感知评估,大大优于所有基线。 GUITestScape 的基准测试进一步表明,检测仍然是跨两种缺陷类型的现有模型的关键瓶颈,并且将 GUIJudge 的验证器集成到现有代理中可以显着提高其检测性能,而无需重新训练。