论文
SLVMBench:从长视频记忆学习技能的基准
SLVMBench: Skill Learning from Video Memory
摘要
我们推出了从视频记忆学习技能(SLVMBench),这是第一个联合评估视频 大语言模型(视频-LLM)是否可以从长视频记忆中学习技能并将其应用于实时任务的基准测试。 SLVMBench 提供了具有 2-3 小时视频流的模型,其中包含嵌入在任意不相关视频流中的教程视频,类似于现实世界中的人类学习实践。 Video-LLM 被要求应用所获得的技能来回答有关正在进行的视频的实时问题。与强调被动理解的长视频理解基准和依赖简短、即时演示的技能学习基准不同,SLVMBench 测试记忆和提取程序性知识以及将其转移到实时任务的完整流程。此外,严格的人工注释具有亚秒级时间校准、手动设计的问题消除常识性猜测以及整理的教程以确保覆盖所需的技能。对最先进的专有和开源视频 LLM 的评估表明,视频 LLM 在学习和应用视频中的技能知识方面存在很大困难。此外,当技能知识放置在较长的视频记忆中时,性能会显着下降。这些结果揭示了现有视频 LLM 的一个关键局限性,并将 SLVMBench 定位为研究长上下文视频记忆的实时技能获取和应用的第一个基准。