论文
人类水平的准确性,非人类策略:揭示视频物理推理中模型与人类的分歧
Human-Level Accuracy, Non-Human Strategies: Revealing Model-Human Divergence in Video Physical Reasoning
摘要
视频基础模型现在在物理推理基准上达到了人类水平的准确性,但此类任务需要预测未观察到的物理结果。这些模型是否执行类似人类的正向模拟,或者它们是否利用可见场景中的统计规律?仅凭准确性无法区分这些策略。我们引入了一个分布式评估框架,将模型种子和人类评估者视为群体,从而能够比较共识、不确定性和策略。在 Physion 基准测试中,我们评估了三种 ViT-L 架构(V-JEPA2、VideoMAEv2、DINOv2)。 V-JEPA2 将准确度差距缩小到约 1 个百分点(73.2% vs. 74.2%),但模型与人类的分歧达到 26.4%,远远超过人类与人类的分歧(4.8%),一致性要低得多(kappa ~ 0.48 vs. 0.91)。这种分歧遵循正向模拟要求:模型在几何推理(链接,+11.8 pp)方面优于人类,但在重力动力学(滚动,-11.8 pp)和因果链(多米诺骨牌,-10.5 pp)方面表现不佳。策略指纹识别证实所有三种架构都共享非人类策略,但没有一个与人类一致。归因分析表明,不可观察的结果特征,而不是可见的场景属性,预测了这种差异,这与更多依赖场景级统计规律而不是显式前向模拟的模型一致,这是一种仅靠准确性无法揭示的系统性差异。代码可从此 https URL 获取。