论文

Video-Index:视频理解的策划元基准

Video-Index: A Curated Meta-Benchmark for Video Understanding

模型评测基准与评测资源

摘要

视频基准应该奖励其声称测量的能力,但模型可以利用答案选项、问题文本或部分视觉证据。我们介绍了攻击金字塔、五个级别的快捷方式攻击以及增加对每个项目的访问权限,并用它审核了 115 个视频基准。在 35 个基准测试中,从未见过帧的攻击者接近全视频精度。在使用时间探针的 51 个基准测试中,打乱的帧保持了全视频准确度的中位数 96%。 63 个基准测试中至少有一半的问题几乎是重复的。我们从其中的 112 个问答对中筛选出 505,518 个问答对,放入经过审核的池中。Agent将评估请求转化为规范,并且具有红队门的确定性选择器构成可重复的基准。我们发布了视频索引,即四个功能组中每个攻击下的 210 个最难验证的项目,来自 76 个来源的 840 个项目。在相同的固定输入下,Claude Opus 5 的得分比每个开源模型高出超过 37 个百分点,而Agent工具则增加了约 20 个百分点,但所有系统都留有提高效率和准确性的空间。博客:https://www.enxinsong.com/blog/video-index/ GitHub:https://github.com/Espere-1119-Song/Video-Index 拥抱脸:https://huggingface.co/datasets/Video-Index/Video-Index