论文

VeriPhy:用于世界模型评估和细化的代理物理推理

VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

模型评测评测方法与指标

摘要

生成视频中的视觉流畅度并不意味着物理可靠性,仅标量质量分数无法表明剪辑违反的义务或失败的时刻。我们推出了 VeriPhy,一个可审计的物理验证系统,其中纯文本规划器在观察任何帧之前将提示编译为键入的物理义务和静态验证的执行计划。在执行期间,观察门和范围仅声明对冻结的底层专家的调用(例如,分段和跟踪、计数、对结果轨道的十一种类型的物理测量、深度、OCR 和音频事件检测)。每个操作都会返回一个带有来源的证据记录,其有效负载在可用时可以是类型化的测量,也可以是显式标记的学习状态。类型化解析器和固定组合将可用记录映射到具有完整来源的三值状态(支持、矛盾或未知,表现为合理、难以置信或弃权),以便每个判决都可以追溯到产生它的证据。我们将评估锚定在由人工注释的缺陷记录组成的 1,500 个剪辑语料库中,这些记录可以在即时参考、空间和时间上定位真实的生成故障。在包含 304 个此类记录的 149 个剪辑核心中,VeriPhy 占了 228 个,而在相同剪辑和相同声明的情况下,已发布的问题分解评估器占 164 个。仅靠回忆并不能将其与整体提示相同的骨干网分开,该骨干网数量达到 222;它们的区别在于,每个决定都保留其证据记录和出处,使得一次一个判决的痕迹可审计,并且可用作将批评家判决写回到生成中的界面。