论文

通过通用关键帧提取桥接 VideoQA 和视频引导代理任务

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

智能体系统Agent任务评测

摘要

视频理解是多模态智能的一项基本能力,最近的多模态 大语言模型 (MLLM) 在视频问答 (VideoQA) 基准测试中取得了出色的性能。然而,现有的基准主要评估模型是否可以感知浅层视觉线索,而很少检查 MLLM 是否可以从视频教程中学习更深层次的知识或程序技能,并将其推广到下游的长期代理任务。为了解决这一差距,我们引入了VG-GUIBench(视频引导GUI基准),这是一个新的基准测试,旨在评估基于MLLM的GUI智能体是否可以按照视频教程完成相应的GUI交互任务。此外,我们观察到模型在 VideoQA 和视频引导代理任务上的性能关键取决于有效的关键帧提取。基于这一观察,我们提出了 TASKER(任务驱动和场景感知关键帧搜索ER),这是一种关键帧提取算法,联合考虑任务相关性和场景动态来识别信息帧。实验结果表明,TASKER 在 VideoQA 和视频引导代理任务基准上都实现了显着的性能改进,在 EgoSchema 完整集上比最佳基线分别高出 2.0%,在 NExT-QA 数据集上比最佳基线高出 1.8%。这些结果进一步凸显了通用关键帧提取方法在视频理解任务中的潜力。我们的代码和数据可在 https://github.com/VG-GUI-TASKER/VG-GUI-TASKER 获取。