论文

Apple-$π$:通过视频对思维进行基准测试,以实现基于法律的物理智能

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

模型评测基准与评测资源

摘要

现代视频生成模型越来越被誉为具有对物理定律的内在理解的新兴世界模型。然而,现有的基准在很大程度上仅在输出级别评估物理合理性,而没有验证模型是否通过忠实的、基于法律的推理过程到达那里。我们推出 Apple-PI,这是第一个将视频模型评估明确锚定在物理定律中的基准。 Apple-PI 由三个组件组成。 1) Orchard:包含 400 个视频的数据集,涵盖经典力学中的 10 个典型任务。它将用于无混杂诊断的单律任务与用于探测泛化的多律任务分开。 2)基准协议:基于科学推理的三阶段协议,包括感知、表述和演绎。它在信息图注释的第一帧上使用帧链提示,将生成的视频视为模型的可见推理轨迹。 3) 评估套件:混合评估套件,将基于 MLLM 的主观评分与基于物理定律的客观测量相结合。这不仅可以对模型是否失败进行阶段性诊断,还可以对模型失败的位置进行诊断。对 11 个模型进行基准测试表明,当前的视频模型距离可靠的基于规律的世界模拟器还很远,最好的视频模型得分仅为 0.473。我们的阶段、支柱和源解决的分析进一步暴露了感知到公式到演绎的瓶颈、薄弱的多律状态转移以及持续的模拟到真实的差距。这些发现将 Apple-PI 定位为诊断基础,用于指导未来视频模型走向具有基于规律的物理智能的世界模型。