论文
扩展视频生成以进行推理:代价是什么?
Scaling Video Generation for Reasoning: At What Cost?
摘要
我们研究缩放视频生成是否使模型能够推理过去帧中的隐藏信息,以及计算成本是多少。我们的受控基准要求从三个面的固定视图预测最初解决的 2x2x2 魔方的九个指定动作。正确的预测需要推断动作如何改变隐藏状态,并且模拟器提供了准确的评估基础事实。模型很早就学习了合理的立方体几何形状,而正确的贴纸配置则需要更多的训练。尽管验证 MSE 遵循近似幂律缩放,但较低的 MSE 损失并不能可靠地表明下游推理能力。较小的自回归模型可以通过有限的计算实现更高的状态精度,而较大的模型在更多训练后可以达到更高的精度。在大约 0.1 PF 天时,70M 参数模型正确预测了 44.6% 的动作后帧中的可见贴纸配置,而 1B 模型的预测率为 0.3%,在 3.14 PF 天时达到 83.7%。在相同的训练数据预算下,符号状态监督将 20M 模型的帧精度从 31.1% 提高到 67.3%,这表明学习状态变化的表示可以补充缩放。