论文
RefGlitch-Bench:使用视觉语言模型进行基于参考的游戏故障检测的基准
RefGlitch-Bench: A Benchmark for Reference-based Gameplay Glitch Detection with Vision-Language Models
摘要
视频游戏中的视觉故障会降低玩家体验和感知质量,而手动质量保证无法跟上现代游戏开发不断增长的测试面的步伐。先前的自动化工作,特别是那些使用视觉语言模型(VLM)的自动化工作,主要在孤立的帧上运行,没有足够的上下文来判断是否存在故障。我们推出 RefGlitch-Bench,这是使用 VLM 进行基于参考的视频游戏故障检测的基准。关键思想是将故障检测制定为明确的视频内比较问题:给定测试帧,参考帧提供视觉基线,帮助模型区分真正的故障和良性视觉变化。 RefGlitch-Bench 包括一个受控合成数据集,其中包含五种注入故障类型和手动注释的参考/测试帧对,从而实现预言机参考评估,从而隔离参考指导的潜在优势。我们进一步建立了四个初始基线,用于自动从同一视频中的较早帧中选择参考,其中 LastCleanFrame 表现最佳并跨 VLM 传输。最后,我们评估了现实世界游戏数据的自动参考指导,它改进了受控设置之外的帧级故障检测,同时揭示了参考可靠性和错误传播作为关键挑战。代码和数据可在以下网址获取:https://github.com/PipiZong/RefGlitch-Bench.git。