论文
BVB:通过 Blender 中的编程重建对代理视频理解进行基准测试
BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender
摘要
多模态代理可以通过编码在 Blender 等软件中创建复杂的视频,而无需依赖扩散模型。然而视频理解基准仍然主要通过问答来评估模型。如果代理真正理解视频,它可以以编程方式重建它。我们引入了 BVB(Blender-VideoBench),这是一个基准测试,通过要求代理将现实世界的视频重建为动画 Blender 场景来测试这种能力。为了确保公平比较,每个代理通过轻量级工具 Mini-BVB 在共享成本限制下的相同沙箱中对重建进行编程。该基准测试从其动画相机渲染每个重建,并在两个轴上对其进行评估:(1) 双 VQA 测量重建保留了多少时空事实。 (2) 潜在相似度衡量重建在感知上与源视频的匹配程度。我们的总体得分(平方根平均值)有利于平衡的表现。我们评估了 10 个模型系列的 51 种配置,并分析了语义保留、感知相似性、推理工作量和成本。最佳模型达到 88.6 潜在相似度,但仅保留了 53.7% 的源正确时空答案。额外的推理可以提高视觉相似性,但并不能缩小事实准确性方面的差距。在一项对 15 名评估者和五种配置进行的盲目研究中,潜在相似性与人类偏好密切相关。这些结果表明,程序化重建是对代理视频理解的可行测试,而语义保留仍然是主要挑战。