论文

视频世界模型可以跟踪未观察到的世界状态吗?

Can Video World Models Track Unobserved World States?

模型评测模型行为与机制分析

摘要

视频世界模型越来越多地用作模拟器,但仅凭视觉保真度并不能表明模型保持了世界的隐藏状态。我们通过动作条件视频 Shell Game 来检查这一差距,这是 $S_5$ 状态跟踪的视觉模拟,它将视觉渲染与合成下面的隐藏状态分离。双向和自回归 Transformer、Mamba 和仅限于非负转换特征值的线性注意力都适合 5 次交换的训练范围,然后在更长的交换链(外推)上落入机会,同时仍然通过额外的去噪步骤渲染合理的视频,但没有任何好处。基于像素的扩散目标从不监督看不见的隐藏状态,因此生成的帧无法携带它,并且状态必须存在于架构内部而不是词元中。对于 Transformer,该架构状态只是一个仅附加的 KV 缓存,因此模型必须从每个块的整个历史记录中重新导出隐藏的排列。我们发现两种可以进行推断的机制,并且都可以跨块携带状态并就地修改它。一旦其转换特征值可能为负,线性注意力就会成功,而具有非线性快速权重的 TTT 通过更新特征图来成功,通过特征图读取自己的状态。我们进一步研究动态世界探索任务中更困难的情况,并讨论构建有状态视频世界模型的更广泛的影响。