论文
Video-Zero:自我进化视频理解
Video-Zero: Self-Evolution Video Understanding
摘要
自我进化为改进推理模型提供了一条有前途的途径,而无需依赖密集的人类注释。然而,将这种范式扩展到视频理解仍然没有得到充分探索和挑战:视频很长、动态且冗余,而推理所需的证据通常稀疏且时间局部化。因此,从完整视频中天真地生成困难的问答对可能会产生看似具有挑战性但基础薄弱的监督,依赖于静态线索或语言先验而不是时间证据。在这项工作中,我们认为视频自我进化的关键瓶颈不仅仅是难度,而是基础。我们提出了 Video-Zero,一种无注释的提问者-解答者共同进化框架,该框架将自我进化集中在时间局部证据上。发问者发现信息丰富的证据片段并生成基于证据的问题,而解答者则学习回答并将其预测与支持证据相结合。这就形成了证据发现、扎根监督和证据一致学习的迭代循环。在涵盖时间基础、长视频理解和视频推理的 13 个基准测试中,Video-Zero 持续改进了多个视频 VLM 主干,证明了以证据为中心的自我进化的有效性和可转移性。