论文

ViBR:使用视觉语言模型从基于视频的报告自动重放错误

ViBR: Automated Bug Replay from Video-based Reports using Vision-Language Models

摘要

错误报告通过帮助用户向开发人员传达遇到的问题,在软件维护中发挥着至关重要的作用。最近,GUI 屏幕捕获视频由于其易用性和保留丰富上下文信息的能力而作为错误报告工件而受到欢迎。然而,从此类录音中自动重现错误仍然是一个重大挑战。现有方法通常依赖于脆弱的图像处理启发式、显式触摸指示器或预先构建的 UI 转换图,这需要重要的仪器和特定于应用程序的设置。本文介绍了 ViBR,这是一种轻量级且完全自动化的方法,可以直接从 GUI 记录中重现错误。具体来说,ViBR 将用于动作边界分割的基于 CLIP 的嵌入相似性与用于区域感知 GUI 状态比较和引导错误重放的视觉语言模型 (VLM) 相结合。实验结果表明,ViBR 成功重现了 72% 的错误记录,显着优于最先进的基线和消融变体。