用于长视频理解的在线视频代理工具
Online Video Agent Harness for Long Video Understanding
摘要
长视频理解通常表现为视觉大海捞针问题:与查询相关的证据在较长的时间跨度上稀疏分布,而将密集帧打包到单个 VLM 上下文中会导致 \textit{context rot} 和高成本。现有的视频代理通常依赖与查询无关的离线预处理或临时工具集,这可能会错过特定于查询的细节并浪费计算。在这项工作中,我们提出了 VideoXAgent,这是一种用于长视频理解的纯在线视频代理工具,它从给定的视频文件和用户查询开始,计划和分解任务,按需调用专门的专家工具,并聚合多模态证据以产生最终答案,同时解决观察之间的冲突。为了支持这种按需调用,我们设计了一套异构专家工具,以数据驱动的原子功能分类法为指导,涵盖脚本、VLM 和域模型(例如检测、OCR、ASR、人脸识别)。该Harness进一步加强客观证据提示和预算意识控制,以遏制幻觉和不终止。在 Video-MME-Long、LongVideoBench-Long、LVBench 和 MINERVA 中,VideoXAgent 在较小的上下文占用范围内与前沿 LMM 和视频代理竞争——每个样本大约 50k 代理上下文词元,即使在长达一小时的视频上也是如此。特别是,在复杂的视频推理基准(例如 MINERVA)上,它在仅使用 1,024 帧密集包装基线的大约 15% 上下文的情况下达到了这一水平。值得注意的是,该工具对于视觉弱甚至仅文本的编排器仍然有效,这表明强大的长视频理解可以从渐进的代理证据寻求中产生,而不是从将完整视频打包到单个上下文中。项目页面:https://go-agent-x.github.io/video_agent_harness/