论文
评估视频游戏 QA 中自主代理驱动的几何裁剪检测的 VLM
Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA
摘要
在这项工作中,我们研究了如何使用视觉语言模型 (VLM) 在代理驱动的游戏质量保证 (QA) 管道中进行异常检测,重点关注几何裁剪。在此评估中,自定义探索代理导航游戏级别以收集视觉观察结果,而自动注释管道提供帧级剪辑标签。此设置使我们能够在受控异常检测任务上评估最近的 VLM,而无需手动注释。我们在零样本提示设置下对最近的 6 个 VLM(Gemini、GPT、Qwen、Gemma、Llama 和 Ministral)进行了基准测试,并分析了它们对四种提示变体的敏感性。我们的结果表明,虽然 VLM 可以捕获与几何裁剪相关的视觉线索,但它们都会对视觉模糊的帧(例如近接触几何和部分遮挡)产生大量误报。 Gemini-3.1-Flash 实现了最佳的整体准确性,并且对提示变化最稳健,而开源模型则表现出很大的精度——召回波动取决于提示设计。这些发现表明,当前的 VLM 最适合作为多级 QA 管道中的高召回率候选过滤器,而不是作为独立的错误检测器。