论文
选择的未来仍然可以重写:视频模型中的因果可写性
A Chosen Future Can Still Be Rewritten: Causal Writability in Video Models
摘要
当视频模型生成物理上不正确的运动时,它是否无法学习正确的运动,或者它是否学习了但无法使用它?我们展示后者:正确的运动在模型内部仍然可用,并且仍然可以用来控制生成的视频。我们在视频中进行训练,其中红色质量缓慢振荡,蓝色质量快速振荡,然后通过观察到的快速运动来测试红色质量。即使模型在这种冲突的情况下生成慢运动,从简单物理变量预测的低维编辑也会恢复正确的快速运动。我们将这种能力称为因果可写性。在固定强度下,我们发现了清晰的深度边界:相同的编辑会更改边界之前的视频,但不会更改边界之后的视频。此关闭标志着对该写入的承诺。尽管如此,运动信号仍然存在,更强的下游写入可以恢复物理运动,而过多的增益会出现过冲。早期因果可写性预测了稍后训练会纠正哪些错误:这些错误比持续存在的错误可以在更多的网络深度上写入。我们在预训练的 1.3B 视频模型中重现了因果可写性及其急剧闭合,支持跨模型规模和训练机制的通用性。