论文
AgentVidBench:用于评估 MLLM 代理的多跳视频问答基准
AgentVidBench: A Multi-Hop Video Question Answering Benchmark for Evaluating MLLM Agents
摘要
全面的视频理解对于推动人工智能走向物理世界的复杂动态至关重要。虽然多模态大型语言模型 (MLLM) 的最新进展在视频理解方面展现了卓越的能力,但现有基准仍然局限于简单的场景级查询或仅需要单步推理的全局摘要。现实世界的视频理解涉及更具挑战性的任务,需要多跳多模态推理,并且严重缺乏能够严格评估这些代理能力的视频基准。为了弥补这一差距,我们引入了 AgentVidBench,这是一个多跳视频问答基准测试,专注于评估 MLLM 代理的空间、时间和因果推理能力。除了标准的问答对之外,AgentVidBench 还提供分步解决方案跟踪来支持轨迹评估,评估代理是否明确获取了证明其答案所需的证据。对 12 个专有和开源 MLLM 进行的实验表明,AgentVidBench 上的单轮性能仍然有限,而将这些模型集成到最先进的代理工作流程中通常会提高准确性和轨迹分数方面的性能。我们进一步提出了一种简单而有效的代理策略,作为 AgentVidBench 的竞争基准,将我们的基准建立为未来代理视频理解研究的整体测试平台。代码和数据集可从此 https URL 和此 https URL 获取。