论文

VideoKR:迈向知识和推理密集型视频理解

VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding

模型训练合成数据

摘要

我们推出VideoKR,这是第一个专门用于加强知识和推理密集型视频理解的大型训练语料库。它包含 315K 个视频推理示例,超过 145K 个新收集的 CC 许可的专家领域视频。我们开发了一个以人为本、以技能为导向的示例生成管道,其目标是逐步加深视频推理能力,同时确保示例及其 CoT 原理的难度、多样性和可靠性。我们还策划了 VideoKR-Eval,这是一个新的专家注释基准,其中的问题需要真正的视频理解和知识密集型推理,而不是文本快捷方式。我们的实验表明,在标准 SFT$\rightarrow$GRPO 管道下,在 VideoKR 上进行后训练的模型在知识密集型视频推理方面优于先前的 后训练 方法,同时在一般视频推理方面保持竞争力,这凸显了数据设计是视频推理进展的关键驱动力。我们进一步进行全面的消融,以隔离 VideoKR 的贡献,为未来的工作提供可操作的见解。