论文

通过视觉效果预评估增强 Android 应用程序基于 LLM 的错误重现

Enhancing LLM-Based Bug Reproduction for Android Apps via Pre-Assessment of Visual Effects

摘要

在Android应用的开发和维护中,快速、准确地重现用户报告的Bug对于保证应用质量、提高用户满意度至关重要。然而,这个过程通常既耗时又复杂。因此,需要一种自动化方法,可以探索被测应用程序 (AUT),并在仅给出完整的错误报告的情况下识别重现错误所需的用户界面 (UI) 操作的正确顺序。 大语言模型 (LLM) 在理解文本和视觉语义方面表现出了卓越的能力,使其成为规划 UI 操作的有前途的工具。然而,我们的研究表明,即使使用最先进的基于 LLM 的方法,这些方法仍然难以遵循详细的错误重现指令并根据新信息重新规划,因为它们无法准确预测和解释 UI 组件的视觉效果。为了解决这些限制,我们提出了 LTGDroid。我们的见解是在探索过程中在当前 UI 页面上执行所有可能的 UI 操作,记录其相应的视觉效果,并利用这些视觉提示来指导 LLM 选择可能重现错误的 UI 操作。我们根据来自 45 个流行 Android 应用程序的 75 个错误报告组成的基准评估了使用 GPT-4.1 实例化的 LTGDroid。结果显示,LTGDroid 的重现成功率为 87.51%,比最先进的基线提高了 49.16% 和 556.30%,同时成功重现错误平均需要 20.45 分钟和大约 0.27 美元。 LTGDroid 实现可在 https://github.com/N3onFlux/LTGDroid 上公开获取。