论文
物理量存在于激活中吗?视频扩散模型中的物理定位
Does Physics Live in the Activations? Localizing Physical Quantities in Video Diffusion Models
摘要
视频生成模型产出惊人的逼真序列并被日益提议为世界模型,但近期基准揭示其物理推理的显著缺陷。这引出问题:这些模型是内化了物理原理还是仅复现熟悉的运动模式?我们通过探查视频扩散Transformer(DiT)的内部表示来回答——针对跨越运动学运动与重力及接触下刚体动力学的仿真器导出真值物理量。我们发现:这些量在去噪过程早期即可以高准确率线性解码,大幅超越直接从模型自身加噪潜变量解码的基线,表明相关物理信息在去噪中被主动构建而非已存在于输入。此外,物体上token的激活携带相关物理信息,跨多帧定义的量可从单一潜帧读取。因此信息在token序列内被锐利定位——全局计算、局部存储。探针还显示部分外推:迁移到训练范围外的场景变化与物体配置,故其所读不只是拟合场景的关联物。当直接在全分辨率激活空间拟合时,探针方向可作为改变模型输出的引导向量。