论文

DenseStep2M:用于密集教学视频注释的可扩展 无需训练 管道

DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation

模型训练合成数据

摘要

长期视频理解需要解释复杂的时间事件并对程序活动进行推理。虽然教学视频语料库(如 HowTo100M)为 模型训练 提供了丰富的资源,但它们也带来了重大挑战,包括嘈杂的 ASR 转录以及叙述和视觉内容之间不一致的时间对齐。在这项工作中,我们引入了一个自动化的 无需训练 管道,用于从野外教学视频中提取高质量的程序注释。我们的方法将视频分割成连贯的镜头,过滤不一致的内容,并利用最先进的多模式和 大语言模型(Qwen2.5-VL 和 DeepSeek-R1)来生成结构化的、基于时间的程序步骤。该管道产生 DenseStep2M,这是一个包含大约 100K 视频和 2M 详细教学步骤的大型数据集,旨在支持全面的长格式视频理解。为了严格评估我们的流程,我们策划了 DenseCaption100,这是高质量、人工编写的字幕的基准。评估表明我们自动生成的步骤和人工注释之间具有很强的一致性。此外,我们验证了 DenseStep2M 在三个核心下游任务中的实用性:密集视频字幕、程序步骤基础和跨模式检索。在 DenseStep2M 上微调的模型在字幕质量和时间定位方面取得了显着的进步,同时在自我中心、外中心和混合视角领域表现出强大的零样本泛化能力。这些结果强调了 DenseStep2M 在促进高级多模态对齐和长期活动推理方面的有效性。我们的数据集可从 https://huggingface.co/datasets/mingjige/DenseStep2M 获取。