论文

EgoEsportsQA:电子竞技中感知和推理的以自我为中心的视频基准

EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports

模型评测基准与评测资源

摘要

虽然视频 大语言模型 (Video-LLM) 擅长理解慢节奏、现实世界中以自我为中心的视频,但它们在高速、信息密集的虚拟环境中的功能仍未得到充分开发。现有的基准测试侧重于日常活动,但缺乏严格的测试平台来评估虚拟场景中的快速、受规则约束的推理。为了填补这一空白,我们推出了 EgoEsportsQA,这是一种开创性的视频问答 (QA) 基准,用于将感知和推理融入专家电子竞技知识中。我们通过可扩展的六阶段管道,从 3 个第一人称射击游戏的专业比赛中策划了 1,745 个高质量的 QA 对。这些问题被构造成一个二维解耦分类法:认知能力维度(涵盖感知和推理水平)的11个子任务和电子竞技知识维度的6个子任务。对最先进的Video-LLM的综合评估表明,当前模型仍然未能达到令人满意的性能,最好的模型只有71.58%。结果暴露了两个轴上的显着差距:模型在基本视觉感知方面表现出比深层战术推理更强的能力,并且它们比细粒度的微观操作更好地掌握整体宏观进展。大量的消融实验证明了当前 Video-LLM 架构的固有弱点。进一步的分析表明,我们的数据集不仅揭示了现实世界和虚拟自我中心领域之间的联系,而且还为优化下游电子竞技应用程序提供了指导,从而促进了 Video-LLM 在各种自我中心环境中的未来发展。