论文
VidHarness:不断发展的AgentHarness,以实现经济高效的长视频理解
VidHarness: Evolving Agent Harnesses for Cost-Efficient Long Video Understanding
摘要
视觉语言模型(VLM)可以回答有关长达一小时的视频的问题,但处理每一帧的成本却高得令人望而却步,尽管问题的证据通常只持续几秒钟。视频Agent,即围绕冻结的 VLM 的Harness程序,通过有选择地观察视频来解决这个问题,但现有的Harness是由专家通过缓慢的构建和测试周期手工制作的。我们提出了 VidHarness,这是一个自动化Harness设计的框架,可实现经济高效的长视频理解,其中Harness提议者根据来自演化环境的执行反馈迭代地演化Harness。为了避免贪婪细化的局部最优,我们将进化组织为蒙特卡罗树搜索(MCTS),并且为了降低评估成本,我们集成了不确定性感知的多保真度验证,该验证在几个问题上筛选新的工具,并仅推广有前途的工具。由于最佳的Harness随帧预算而变化,我们进一步引入了Harness混合,将每个问题路由到专门针对其预算的Harness。 VidHarness 在 LongVideoBench、Video-MME 和 Video-Holmes 上取得了新的最先进结果,比最强的手工制作视频Agent高出 11.2个百分点,并以不到一半的均匀采样帧推广到知识密集型基准 Video-MMMU 和 MMVU。