论文
MBench:视频世界模型内存能力的综合基准
MBench: A Comprehensive Benchmark on Memory Capability for Video World Models
摘要
基于视频的世界模型的最新进展展示了合成高保真视觉序列的前所未有的能力。然而,视觉上合理的视频生成和世界模型的功能要求之间仍然存在根本差距,特别是在延长时间范围内保持稳定和合理的内部状态方面。虽然现有的基准主要强调视觉质量、运动连贯性和文本视频对齐,但它们在很大程度上忽视了记忆,而记忆是世界模型在长期视野和复杂交互中保持一致性的核心能力。为了解决这一差距,我们提出了 \textbf{MBench},这是一个致力于量化和评估视频世界模型的内存能力的综合基准。我们系统地将视频世界模型的记忆能力分解为三个层次互补的核心维度:实体一致性、环境一致性和因果一致性,并进一步细化为12个可量化的子维度,以全面表征长期记忆。我们的基准建立在严格策划的真实拍摄的长视频的基础上,并通过基于规则的定量矩阵和 VLM 进行评估,以实现客观、全面的一致性评估。对主流最先进视频世界模型的广泛评估揭示了现有方法在长期状态保留方面的关键系统局限性,为推进该领域提供了标准化基准和明确的研究方向。