论文

SynMulti:多模态视频理解的合成到真实学习

SynMulti: Synthetic-to-Real Learning for Multimodal Video Understanding

模型训练合成数据

摘要

训练用于视频理解的多模态 大语言模型 (MLLM) 需要跨越对象计数、问答和分割等不同任务的大规模注释数据。然而,在现实世界中收集和注释多模态视频数据成本高昂、速度缓慢,并且多样性和覆盖范围本身就受到限制。为了应对这一挑战,我们提出~\textbf{SynMulti}数据集,以及一个统一的合成数据生成管道,能够自动生成具有丰富多样监督的无限多模态视频数据。我们的框架支持单个管道中的多种任务格式,从而实现跨任务的可扩展且一致的数据创建。为了进一步增强推理能力,我们引入了基于 VQA 的 微调 策略,该策略训练模型回答有关视觉内容的结构化问题,而不是仅仅依赖图像描述或简单指令。这种表述鼓励更深入的视觉基础和推理。我们在三个具有挑战性的任务中评估我们的方法:视频对象计数、基于视频的视觉问答和视频对象分割。实验结果表明,主要基于合成数据训练的模型可以有效地推广到现实世界的数据集,通常优于传统训练的模型。我们的研究结果强调了统一合成数据管道作为多模态视频理解昂贵的现实世界注释的可扩展替代方案的潜力。