论文
EvoGround:用于视频时序定位的自我进化视频代理
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
摘要
视频时序定位 (VTG) 将未经修剪的视频和自然语言查询作为输入,并定位与查询最匹配的时间时刻。现有方法依赖于大型的、特定于任务的数据集,需要昂贵的手动注释。我们引入了 EvoGround,这是一个由两个耦合的自我进化代理(一个提议者和一个求解器)组成的框架,它可以从原始视频中学习时间基础,而无需任何人类标记的数据。提议器从原始视频中生成查询时刻对,而求解器则学习如何将它们时序定位并反馈信号以改进提议器作为回报。通过这种自我强化的强化学习循环,两个代理从同一主干初始化,并在迭代中相互改进。 EvoGround 在 2.5K 无标签视频上进行训练,在多个 VTG 基准上匹配或超越完全监督模型,同时成为最先进的细粒度视频字幕生成器,无需手动标签。