论文

视频模型离真正的多模态推理还有多远?

How Far Are Video Models from True Multimodal Reasoning?

模型评测基准与评测资源

摘要

尽管通用视频模型取得了显着进展,但一个关键问题仍未得到解答:这些模型距离实现真正的多模态推理还有多远?现有的基准无法严格解决这个问题,因为它们仍然受到简单的任务设计和分散的评估指标的限制,而忽略了复杂的多模态推理。为了弥补这一差距,我们引入了 CLVG-Bench,这是一个评估框架,旨在通过视频生成中的上下文学习来探索视频模型的零样本推理能力。 CLVG-Bench 包含 6 个类别和 47 个子类别的 1,000 多个高质量、手动注释的元数据,涵盖物理模拟、逻辑推理和交互式上下文等复杂场景。为了实现严格且可扩展的评估,我们进一步提出了一种自适应视频评估器(AVE),它使用最少的注释与人类专家的感知保持一致,在不同的视频上下文任务中提供可解释的文本反馈。大量的实验揭示了我们核心问题的惊人答案:虽然 Seedance 2.0 等最先进的 (SOTA) 视频模型在某些理解和推理子任务上表现出了能力,但它们在逻辑基础和交互式生成任务方面远远落后(成功率分别<25% 和 ~0%),将多模态推理和物理基础暴露为关键瓶颈。通过系统地量化这些限制,所提出的方法提供了可操作的反馈和清晰的路线图,以实现真正稳健的通用视频模型。 CLVG-Bench 和代码已在此处发布。