论文

VideoNet:用于特定领域动作识别的大规模数据集

VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition

模型评测基准与评测资源

摘要

视频的独特之处在于能够捕捉超越多个帧的动作。因此,多年来动作识别一直是视频理解的典型任务。不幸的是,由于缺乏足够多样化和具有挑战性的数据,现代视觉语言模型(VLM)不再评估其动作识别能力。为了在 VLM 时代重振动作识别,我们主张重新关注特定领域的动作。为此,我们引入了 VideoNet,这是一个特定于领域的动作识别基准,涵盖来自 37 个领域的 1,000 个不同动作。我们从多项选择评估设置开始,封闭式模型和开放式模型之间的差异非常明显:Gemini 3.1 Pro 的准确率达到 69.9%,而 Qwen3-VL-8B 的准确率仅为 45.0%。为了理解为什么 VLM 在 VideoNet 上表现不佳,我们将问题放松到二进制设置中,其中随机概率为 50%。尽管如此,Qwen 的准确率仅为 59.2%。进一步放宽评估设置,我们提供了 $k\in\{1,2,3\}$ 操作的上下文示例。有些模型在少样本设置中表现出色,而另一些模型则表现不佳; Qwen 提高了 $+7.0\%$,而 Gemini 则下降了 $-4.8\%$。值得注意的是,在给出少数样本的情况下,这些收益低于非专家人类的 $+13.6\%$ 改进。发现 VLM 难以充分利用上下文示例,我们从测试时改进转向训练方面。我们收集了第一个针对特定领域操作的大规模训练数据集,总计近 50 万个视频问答对。 微调 是我们数据上的 Molmo2-4B 模型,我们在 VideoNet 基准测试上超越了所有开放权重 8B 模型。