论文

VI-Bench:AIGC 视频的基准提示反演

VI-Bench: Benchmarking Prompt Inversion from AIGC Videos

模型评测基准与评测资源

摘要

视频生成领域的最新进展使得基于提示的控制对于 AIGC 视频生成越来越重要。提示指定视频应描绘的内容以及应如何表示,控制视觉风格或摄像机行为等因素。了解这种可恢复性对于创意重用和编辑以及评估即时泄漏风险都很重要。然而,现有的视频理解基准并没有衡量这种能力:标题可以描述可见的内容,但可重播的提示必须恢复再现视频所需的与生成相关的控件。为了弥补这一差距,我们推出了 VI-Bench,这是一个由 1610 万条真实用户提示和 900 个经过人工验证的 AIGC 视频构建的基准测试。 VI-Bench 跨越三个逐渐困难的设置,即单镜头语义基础、对风格和相机行为的控制以及多镜头构图反转,并评估五个世代关键维度:主题、动作、场景、风格和相机。我们评估了 18 个代表性 VLM,包括 VI-Bench 上的 2 个专有模型和 16 个开源模型,使用反转分数来衡量提示级别与原始提示的对齐情况以及重新生成视频的视频级别保真度。结果揭示了很大的局限性:即使是最强的模型在反转分数上也只能达到 0.632,由于样本需要更丰富的控制和多镜头推理,性能会急剧下降,并且模型经常会产生看似合理的提示,但重新生成的视频会偏离参考。这些发现表明,视频提示反转是一种独特且被低估的能力,需要模型将视觉理解转化为回放稳定的生成控制。