论文

BeyondMasks:评估视频对象移除中的因果和物理一致性

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

模型评测基准与评测资源

摘要

生成视频模型的最新进展显着提高了视频对象去除的视觉真实感,但评估协议仍然关注屏蔽区域保真度,将去除视为局部修复。在真实场景中,对象移除是一种因果干预:消除对象还需要移除其引发的物理效果,例如阴影、反射、光照变化、半透明和动态痕迹。现有基准缺乏一致的干净参考或仍然仅限于简化的合成设置,从而阻碍了因果一致性的系统评估。我们推出 BeyondMasks,这是一个用于因果一致视频对象删除的配对基准,由时间对齐的合成视频对和真实世界视频对组成,并具有干净的背景参考。该数据集涵盖不同的光度、几何、体积和动态交互,并支持基于掩模和指令驱动的编辑。我们进一步提出了 CORE,一种基于结构化视觉语言模型的评估协议,它联合测量对象消失和后效一致性,比现有指标更符合人类判断。对最先进的方法进行基准测试揭示了尽管屏蔽区域保真度很高,但在消除次要物理效应方面存在系统性失败,暴露了视觉合理性和因果正确性之间的差距。 BeyondMasks 将视频对象去除重新定义为因果场景一致性而不是局部重建,并为其评估提供了统一的框架。