论文
GameplayQA:3D 虚拟代理的决策密集 POV 同步多视频理解的基准框架
GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
摘要
从机器人到虚拟世界,多模态 LLM 越来越多地被部署为 3D 环境中自主代理的感知骨干。这些应用程序要求代理感知快速的状态变化,将操作归因于正确的实体,并从第一人称视角推理并发的多代理行为,现有基准无法充分评估这些功能。我们介绍 GameplayQA,一个通过视频理解评估以主体为中心的感知和推理的框架。具体来说,我们以 1.22 个标签/秒的速度对多人 3D 游戏视频进行密集注释,并提供围绕自我、其他代理和世界三元系统构建的状态、动作和事件的时间同步、并发描述,这是多代理环境的自然分解。根据这些注释,我们精炼了 2.4K 诊断 QA 对,将其组织为三个认知复杂度级别,并附有结构化干扰分类法,可以对模型产生幻觉的位置进行细粒度分析。对前沿 MLLM 的评估揭示了与人类表现的巨大差距,在时间和跨视频基础、代理角色归因以及处理游戏决策密度方面存在常见故障。我们希望 GameplayQA 能够促进未来在具体人工智能、代理感知和世界建模交叉领域的研究。