论文

GeoT2V-Bench:通过 3D 重建对文本到视频模型的 3D 一致性进行基准测试

GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction

模型评测基准与评测资源

摘要

相机提示的文本到视频 (T2V) 模型越来越多地用于合成虚拟相机捕获的图像,例如绕轨道运行的物体或在静态场景中移动。对于这些输出,视觉可信度是不够的:生成的帧还应该为单个静态 3D 场景提供连贯的多视图证据。我们推出了 GeoT2V-Bench,这是一种基于重建的诊断基准,用于评估相机提示的 T2V 剪辑是否可以支持显式刚性 3D 重建。我们的管道使用 VGGT 式几何估计来估计每帧相机的内在特征和姿势,适合 DeformableGS,通过时间中值聚合导出静态 MedianGS 代理,并沿着估计的相机路径渲染该代理。 GeoT2V-Bench 不是生成通过/失败标签或单个标量分数,而是报告连续重建轮廓,涵盖明显图像运动、估计轨迹行为、MedianGS 静态渲染误差、静态渲染流协议以及灵活和静态拟合之间的差距。在公平格式四种子评估中,根据 12 个开放权重模型配置和 80 个 GeCo-Eval 静态场景提示完成了 3,840 个重建,我们发现可见运动、静态渲染错误、流程一致性以及灵活与静态行为常常不一致。因此,GeoT2V-Bench 捕获了当生成的视频作为全局静态场景采集进行测试时出现的补充故障模式。