论文
Video-Oasis:重新思考视频理解的评估
Video-Oasis: Rethinking Evaluation of Video Understanding
摘要
视频理解固有的复杂性使得很难确定 Video-LLM 基准性能是否源于视觉感知、语言推理或知识先验。尽管已经出现了许多评估高级推理的基准,但评估视频理解的共同标准仍然在很大程度上被忽视。我们没有引入另一个基准,而是退一步重新审视评估视频理解的标准。在这项工作中,我们介绍了 Video-Oasis,这是一个可持续的诊断套件,用于系统地审核现有的视频理解基准。此次审计表明,55\% 的现有基准样本无需视觉输入或时间上下文即可解决。在过滤了这些捷径之后,剩下的视频原生挑战暴露了巨大的能力差距:最先进的模型的表现仅略高于随机猜测。基于这些发现,我们使用蒸馏挑战作为测试平台来研究哪些算法设计选择有助于稳健的视频理解。我们希望我们的工作为构建严格的视频基准和评估未来的 Video-LLM 提供实用的基础。代码可在 https://github.com/sejong-rcv/Video-Oasis 获取。