论文
每个人都有自己的标准:发现用于物理视频评估的 Per-VLM 分类法
Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation
摘要
保持视频生成器和世界模型的物理一致性越来越依赖于视觉语言模型(VLM)作为自动判断器,提供奖励信号、排名决策和数据过滤标准。然而,VLM 在训练数据和架构方面存在很大差异,通过不同的内部表示对物理现象进行编码。因此,单一的全局评估模式为每个 VLM 提供了相同的能力轴,无论每个 VLM 实际感知到什么。我们提出 JudgeFit,这是一种迭代细化程序,可发现每个 VLM 的评估分类法。通过提示目标 VLM 枚举一小组视频上的物理错误并对生成的描述进行聚类来构建初始分类。然后通过诊断步骤完善分类法:我们将 VLM 的每个维度分数校准为人类物理常识评级,诊断其分数不可靠或冗余的维度,并提示 LLM 修复它们,迭代直至收敛。我们进一步将该过程实例化为基准,并将其应用于跨越 8 个模型系列的 16 个 VLM。对于每个测试的 VLM,改进的分类法优于保留视频的全局模式基线,平均相对改进约为 32%。除了总体准确性之外,每个 VLM 配置文件还暴露了总体排名无法预测的特定于模型的盲点,并且不同模型系列的可靠性模式存在显着差异。