论文
TransVLM:用于检测任何镜头转换的视觉语言框架和基准
TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
摘要
传统的镜头边界检测(SBD)本质上是通过围绕孤立的切点制定任务来应对复杂的过渡,经常产生损坏的视频镜头。我们通过形式化镜头转换检测(STD)任务来解决这个基本限制。 STD 不是搜索模糊点,而是显式检测转换的连续时间段。为了解决这个问题,我们提出了 TransVLM,一种针对 STD 的视觉语言模型 (VLM) 框架。与主要依赖于空间语义并与细粒度镜头间动力学作斗争的常规 VLM 不同,我们的方法在输入阶段明确地将光流作为关键运动注入。通过简单而有效的特征融合策略,TransVLM 直接处理串联的颜色和运动表示,显着增强其时间感知,而不会在语言主干上产生任何额外的视觉标记开销。为了克服公共数据中严重的类别不平衡问题,我们设计了一个可扩展的数据引擎来合成各种过渡视频以进行稳健的训练,同时还提供了 STD 的综合基准。大量实验表明,TransVLM 实现了卓越的整体性能,优于传统启发式方法、专门的时空网络和顶级 VLM。如需更多相关研究,请访问 HeyGen Research (https://www.heygen.com/research) 和 HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model)。项目页面:https://chence17.github.io/TransVLM/