论文
MetaVideoAgent:用于长格式视频理解的自动视频代理进化
MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding
摘要
长视频理解需要在长的多模态视频中定位稀疏的、与问题相关的证据。现实世界的视频分布在特定模态的信息密度、内容结构和证据模式方面存在差异,导致固定的视频代理设计在不匹配时产生冗余处理或失败。将自动化代理进化从文本扩展到视频具有挑战性,因为完整的长视频执行使得候选验证成本高昂,故障在耦合的证据处理阶段传播,并且复杂的预处理、感知工具和本地化策略使得代码级更新难以可靠地实现。我们引入了 MetaVideoAgent,一个可以自动为目标分发开发视频代理的框架。它从稀疏采样的帧和相关查询中分析信息密度和证据要求,以指导初始设计,然后将局部故障压缩为独立可执行的最小验证任务。它构建以证据为基础的参考路径(Gold Paths),审核学生轨迹,汇总样本中反复出现的失败,并将其归因于负责的模块。模块化代理表示限制对主要负责模块及其必要依赖项的每次更新。我们进一步介绍 VA-EvoBench,涵盖八个视频发行版,具有单独的演变和保留的分割。每个分布有四次进化迭代,MetaVideoAgent 改进了每个初始代理,并将宏观平均准确度从 38.44% 提高到 51.47%,每个分布的平均进化成本为 354 万个词元。进化后的代理比之前最强的固定设计视频代理的性能高出 6.39 个百分点,同时在比较的视频代理中每个问题使用最少的词元和视频帧。我们将发布所有代码和数据以支持可重复的研究。