论文
NEWTON:以智能体规划约束视频生成的物理一致性
NEWTON: Agentic Planning for Physically Grounded Video Generation
摘要
视频生成模型产生视觉上引人注目的结果,但系统地违反了物理常识——在 VideoPhy-2 上,最好的模型仅达到 32.6% 的关节精度。我们确定了一个规范瓶颈:文本提示是物理世界的有损压缩,省略了完全确定动态的参数,并且任何模型缩放都无法恢复从未指定的内容。从这个诊断中,我们得出物理调节必须满足的三个属性——充分性、动态性和可验证性——并表明现有的方法没有满足这三个属性。我们提出了 NEWTON,其中视频生成从系统输出降级为代理工具箱内的一个操作:一个学习规划器协调物理感知工具(关键帧生成、科学计算、提示细化)来构建丰富的条件,而验证器则关闭循环以进行迭代重新规划。规划器是唯一可训练的组件,通过实时多圈循环内的 Flow-GRPO 优化 同策略。在 VideoPhy-2 上,NEWTON 将 LTX-Video 上的联合精度从 21.4% 提高到 29.7%,将 Veo-3.1 上的联合精度从 30.7% 提高到 37.4%,而无需修改任何一个生成器。我们的项目页面:https://Newton026.github.io/newton