论文

AnyGroundBench:视觉语言模型中视频时空定位的专业领域基准测试

AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 在时空视频时空定位 (STVG) 方面展现出了巨大的前景。然而,当前的评估协议很大程度上仅限于对一般日常生活基准的零样本评估。这与专业领域的现实应用产生了严重的脱节,其中模型不可避免地会遇到罕见的视觉概念和复杂的时空动态。由于跨无限数据分布的详尽 预训练 是不可行的,因此适应新领域的能力至关重要。为了弥补这一差距,我们引入了 AnyGroundBench,这是一个领域适应基准测试,旨在将 STVG 评估范式从静态零样本测试转变为严格的领域适应。 AnyGroundBench 针对五个专业领域(动物、工业、体育、外科和公共安全),将新捕获的视频(例如专家注释的小鼠行为)与已建立的数据集配对,通过密集、高保真时空注释将它们统一起来。至关重要的是,该基准测试提供了专用的训练子集来系统地测量领域适应性。我们广泛评估了 15 个最先进的 VLM,评估了它们在实际计算限制下的零样本泛化和上下文学习 (ICL) 能力。最终,我们的研究结果表明,当前的模型在面对专门领域时,在零样本和基于 ICL 的适应方面都失败了,暴露了未来研究必须解决的时空推理中的关键缺陷。