论文
修剪视觉世界建模评估的长尾
Trimming the Long-Tail of Visual World Modeling Evaluation
摘要
物理交互遵循长尾分布:一组常见且规则的交互主导着人类经验和视觉数据,而广泛的罕见和不规则交互仍然代表性不足。尽管最近的视觉世界模型(包括图像和视频生成模型)在现有基准上实现了令人印象深刻的真实感,但它们主要侧重于模拟常见的物理交互。这就提出了一个核心问题:当前的视觉世界模型是否内化并概括了物理原理?在这项工作中,我们引入了 Tailor-Bench,这是一个挑战世界模型来模拟不规则物理交互的基准。为了实现系统评估,我们设计了三种逐步挑战模型推理的场景模式:常规场景反映常见的工具-任务对,非常规场景用属性兼容的替代品替换传统工具以测试可供性泛化,不可能场景引入属性违反工具来探测约束意识。此外,我们在统一的评估协议下设计了两种互补的设置:预测生成需要在没有指导的情况下推断结果,而描述性生成则指定忠实实现的目标结果。我们的实验结果揭示了物理世界建模中明显的长尾差距:性能从常规场景下降到非常规和不可能场景,表明超出常见交互的泛化能力有限。故障分析进一步表明,模型依赖于表面的视觉模式:图像模型无法实现正确的状态变化,而视频模型还存在时间不一致的问题。