论文
Kairos:用于空间、时间和动力学的细粒度视频语言建模的数据集
Kairos: A Dataset for Fine-Grained Video-Language Modeling over Space, Time, and Dynamics
摘要
许多新兴的视频语言建模任务要求系统超越剪辑级抽象,并对在较长时间范围内展开的视觉内容进行建模。然而,大多数现有视频数据集依赖于粗略或稀疏对齐的监督,这会压缩时间变化并限制模型学习连续视觉动态的可重用表示的能力。我们介绍 Kairos,这是一个用于带有时间解析注释的视频语言建模的视频数据集。 Kairos 由长视频组成,时长从十分钟到半小时不等,并带有细粒度的时间对齐注释。注释捕获正在进行的动作、实体外观和属性、交互以及沿视频时间轴不断变化的上下文线索。这种时间分辨结构支持细粒度评估、远程建模和推理、指令数据构建、表示学习和视频生成。 Kairos 为随时间推移的视觉体验建模提供了通用基础。