论文
VideoGAIA:通用人工智能助理在代理视频理解方面的基准
VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding
摘要
视频理解是评估多模态 大语言模型 (MLLM) 功能的一项基本任务。然而,现有的领先模型在 Video-MME 排行榜上已经达到了约 90% 的准确率,这表明传统的单轮视频理解任务正变得越来越饱和,不足以评估先进 MLLM 的智能。为此,我们推出了 VideoGAIA,这是一种针对通用人工智能 (AI) 助手的代理视频理解基准。 VideoGAIA 超越了一次性视频问答,将视频理解制定为多轮、工具增强的交互过程,其中模型必须迭代地感知视频、调用外部工具、收集补充信息并跨轮集成多模态证据。 VideoGAIA 包含 271 个模型与人类共同设计的任务,涵盖多样化且复杂的现实世界场景。每个视频问答实例均由三名人类专家独立验证,以确保正确性和适当的难度。所有经过评估的 MLLM,包括 GPT-5.5 和 Kimi-K3 等前沿模型,在 VideoGAIA 上的准确率均低于 60%,凸显了其作为评估下一代 MLLM 的高质量和及时基准的价值。我们希望 VideoGAIA 能够促进从传统视频理解向代理视频理解的转变。