论文

OmniVideo-100K:通过结构化脚本和证据链进行视听推理的数据集

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

模型训练合成数据

摘要

当前用于视听问答(QA)的自动化管道通常采用“视频-视频描述-QA”范例。然而,这些方法通常将视频分割成短片,并为音频和视觉模态生成单独的描述。这种解耦处理切断了声音与其视觉源之间的固有关联,而独立的剪辑处理通常会导致跨片段对同一实体的描述不一致。此外,将长文本理解和 QA 合成耦合到一个步骤中通常会将模型限制为局部事件,从而产生缺乏长期时间连接和深度跨模态推理的问题。为了解决这些问题,我们提出了一种具有两种机制的自动化数据引擎:(1)\textbf{实体锚定视频脚本}将视频转换为结构化脚本,包括摘要、主要实体列表和分段视听描述。实体列表充当全局先验,以确保跨段引用一致性并重建视听关联。 (2) \textbf{Clue-Guided QA Generation} 提示模型首先从脚本中挖掘跨段、多模态线索,然后根据这些高价值线索生成 QA 对。利用这个管道,我们构建了指令调整数据集 \textbf{OmniVideo-100K} 和经过人工验证的测试集 \textbf{OmniVideo-Test}。 OmniVideo-100K 上的 微调 VITA-1.5、Qwen2.5-Omni-7B 和 Qwen3-Omni-30B 在 OmniVideo-Test 上的性能提升高达 20.59%,在 Daily-Omni 和 JointAVBench 等既定基准中表现出强大的通用性(高达 12.64% 的改进)。