论文

通过多模态推理主动检测多窗口场景中的 GUI 缺陷

Proactive Detection of GUI Defects in Multi-Window Scenarios via Multimodal Reasoning

摘要

多窗口移动场景(例如分屏和可折叠模式)迫使应用程序适应不断变化的窗口大小和动态布局重排,从而更容易出现 GUI 显示缺陷。现有的检测技术在两个方面受到限制:它们很大程度上是被动的,只有在达到有问题的状态后才分析屏幕截图,并且它们主要是为传统的全屏界面设计的,这使得它们在多窗口设置中效果较差。我们提出了一种用于多窗口移动场景中 GUI 显示缺陷检测的端到端框架。该框架在应用程序探索过程中主动触发分屏、可折叠和窗口转换状态,使用标记集 (SoM) 将屏幕截图与小部件级界面元素对齐,并利用具有思维链提示的多模式 大语言模型 来检测、定位和解释显示缺陷。我们还使用 50 个真实的 Android 应用程序构建了 GUI 显示缺陷的基准。实验结果表明,多窗口设置大大增加了布局相关缺陷的暴露,与传统的全屏设置相比,文本截断增加了 184%。在应用程序级别,我们的方法检测到 40 个容易出现缺陷的应用程序,误报率为 10.00%,漏报率为 11.11%,优于基于 OwlEye 和 YOLO 的基线。在细粒度级别,它实现了小部件遮挡检测的最佳 F1 分数 87.2%。