论文
GUITester:使 GUI 智能体能够进行探索性缺陷发现
GUITester: Enabling GUI Agents for Exploratory Defect Discovery
摘要
探索性 GUI 测试对软件质量至关重要,但人工成本高昂。虽然多模态大语言模型(MLLM)智能体擅长导航,但由于两个核心挑战,它们无法自主发现缺陷:一是目标导向遮蔽(Goal-Oriented Masking),即智能体优先完成任务而忽视报告异常;二是执行偏差归因(Execution-Bias Attribution),即把系统缺陷误判为智能体错误。为解决这些问题,我们首先引入 GUITestBench,这是该任务的首个交互式基准,包含 26 种缺陷下的 143 个任务。随后我们提出 GUITester,一个通过两个模块将导航与验证解耦的多智能体框架:(i) 规划-执行模块(PEM),通过嵌入测试意图主动探测缺陷;(ii) 分层反思模块(HRM),通过交互历史分析解决归因歧义。GUITester 在 GUITestBench 上取得 48.90% 的 F1 分数(Pass@3),优于最先进基线(33.35%)。我们的工作展示了自主探索性测试的可行性,并为未来的 GUI 质量保障提供了坚实基础。我们的代码现已发布于 https://github.com/ADaM-BJTU/GUITestBench。
