论文
TempGlitch:评估游戏视频中临时故障检测的视觉语言模型
TempGlitch: Evaluating Vision-Language Models for Temporal Glitch Detection in Gameplay Videos
摘要
人们越来越多地探索视觉语言模型(VLM)用于视频游戏质量保证,尤其是游戏玩法故障检测。然而,大多数现有的评估将故障视为静态视觉异常,要求模型从单个帧中检测故障。我们认为,这种框架忽略了一个关键区别:一些故障是空间性的,在孤立的框架中可见,而另一些故障是时间性的,只有通过有序框架的变化才会变得明显。一项初步研究证实了这一差距,表明 VLM 检测时间故障比空间故障要困难得多。为了能够系统地评估这一尚未开发的设置,我们引入了 TempGlitch,这是一种用于时间故障检测的受控游戏视频基准。 TempGlitch 涵盖五种时间故障类型,具有平衡的每类别样本,以及配对的无故障视频,可实现可靠的二进制评估。我们跨多个帧采样设置评估了 12 个专有和开放权重 VLM。我们的结果表明,当前的 VLM 在 TempGlitch 上仍然几乎没有机会,通常会陷入过度保守的行为(错过大多数故障)或过度敏感的行为(将干净的视频标记为有故障)。此外,更密集的帧采样和更大的模型尺寸并不能可靠地解决这些故障。 TempGlitch 提供了一个专门的测试平台,用于时间推理、强大的游戏理解以及 VLM 的自动故障检测。代码和数据可在项目网站上获取。