论文

知识密集型视频生成

Knowledge-Intensive Video Generation

模型评测基准与评测资源

摘要

文本到视频的生成在视觉质量方面取得了快速进步,但其真实性和实用性仍然被低估。我们引入知识密集型视频生成(KIVI),模型根据简短的信息搜索提示生成视频,要求解释、过程或演示。为了评估此设置,我们构建了 KIVI-Bench(包含 1,080 个提示的基准),并提出了真实性和有用性的自动指标。人工评估表明,与现有替代方案相比,我们的指标明显更好地符合人工注释。对七种最先进的视频生成模型的实验表明,当前的系统仍然落后于人类的表现,特别是在视觉属性、程序操作和清晰的信息呈现方面。这些结果凸显了 KIVI 作为事实和教学有用视频生成的一个具有挑战性的方向。